机器学习浅谈(三)
一、前言
上一次我们讲到了机器学习的分类,以及他们可以实现的对应目标。这一次我们要讨论为了在材料科学中应用机器学习,我们所需要的两个重要元素,即数据和描述符。
二、数据
之前我们谈到了机器学习的定义,即基于已知的经验自发的提高模型在特定任务中的表现的算法,而此处提到的已知的经验就是数据。可以说数据是机器学习的基本训练要件,大量高质量数据是机器学习具有良好表现的基础。而这些数据既包括材料在各个尺度上的结构,也包括材料具备的性质。这些数据的来源非常广泛,既可以是来自于我们自己的实验和模拟,也可以是来自于已发表的文献,或者可以直接使用我们之前盘点过的材料数据库,比如ICSD,oqmd,Materials Project等。
《各种计算相关数据库汇总》
三、描述符
然而单纯的数据是无法使得机器学习和理解我们所要描述的材料,因为机器没有思想,不会理解。为什么这样说呢,我们可以假设一个情况,即如果我们给机器学习提供了一个POSCAR文件,它其中记录了晶胞的晶格常数,晶胞内所含的元素种类,以及它们对应的坐标。我们能否说机器可以通过这个POSCAR文件就能理解这是什么晶体结构呢。显然是不行的,因为我们的机器学习不知道什么是晶体学,也不知道什么是元素周期表。即便我们能找到人类所有已知的晶体结构,单纯给机器提供这样的数据,机器学习很难在短时间内理解这些人类花了几百年时间才了解的内容(我并不是说机器学习没有这样的能力,但是想实现这一目标所需消耗的运算资源是一场巨大的)。因此,我们要人为的帮机器学习补上这些课程,也就是我们需要设计一些描述符来描述已知的材料,从而让机器学习能够更快的了解我们想描述的材料。
这些描述符被定义为材料特征的描述性参数。尽管这是一个很抽象的概念,但却不难理解,就是我们在机器和我们人类之间建立了一套可以相互交流的语言体系。举例来说,刚才提到的POACAR文件对于人类来说反映了一个晶体结构中的结构信息和化学信息。结构信息可以通过空间群,对称性,原子的相对位置进行详细描述;化学信息则需要我们对每个元素进行一定的描述,比如元素的原子序数,半径,电负性等。
简单总结一下,我们今天了解了数据和描述符,以及在描述材料时使用描述符的意义。而材料的描述符一般应具备四个特征,即可重复性,有效性,可分辨性以及简单性,它们的具体含义将在下一次和大家分享。
评论
天玑智研

干货推荐

免疫荧光染色全流程
7330a6d4
34 1

神经元
Mr弘🔬
77 7

血脑屏障超微结构
Mr弘🔬
118 9

二氧化碳捕集及资源化利用:从"废气"到"碳资源"的产业革命
春风得意马蹄疾
76 2

计算机材料设计Materials-Studio教程12
活着
44 2

分子动力学模拟:从原始轨迹到科学结论的推理路径解析
吃鱼不
123 3
