arXiv | 图表示方法驱动大分子计算研究

简介: arXiv | 图表示方法驱动大分子计算研究

image.png

今天给大家介绍的是麻省理工学院(MIT)材料科学与工程系研究人员近期发表在arXiv上的一篇有关大分子表示的研究。作者提出一种大分子的图表示方法,为大分子的表示、比较和学习提供了一个通用框架;并实现了定量的化学信息决策和大分子化学空间的迭代设计。


介绍


生物大分子构成了生命的基础,是生存和生长的强大动力。单个大分子是由单体,用于连接的键及空间排列组合而成。研究人员通过改变单体,键和拓扑结构(线性和非线性,如支链形,星形和瓶刷形)探索了广阔的化学空间。与用于表示小分子的SMILES类似,大分子可以用线性表示法表示。但如蛋白质和DNA/RNA的线性生物大分子例外,它们通常用单个或三个字母的单体编码的序列表示。但这些方式常常受到其化学空间的覆盖范围以及支持所有拓扑结构的能力的限制,并且常常要根据单体的不同而重新设计表示方式。


近年来,有许多利用序列比对,编辑距离,线性核和深度学习方法计算大分子相似性的工作,但这些方法仅限于生物大分子,不能扩展到一般的大分子化学空间,并且现有的用于生物大分子的工具不允许掺入非天然单体,除了聚糖特异性工具之外,也不能处理非线性拓扑结构。


这项工作中,作者提出了一种用于表示大分子的图表示方法,使用带有Tanimoto化学相似性矩阵和传播图核(propagation graph kernels)的图编辑距离(graph edit distances,GEDs)来计算图相似性。此外,还针对不同的任务训练了一套图神经网络模型,在聚糖数据集上取得了最好的结果。


模型


作者使用通用文本文件格式将大分子结构转换为机器可读格式。文本文件包含3个部分-SMILES,MONOMERS和BONDS。然后将大分子解析成带有节点和边属性的NetworkX图,使用立体化学扩展连通性指纹对单体和键分子进行特征化。这种表示方式使大分子在其原生状态下的立体化学和拓扑的明确功能化的描述成为可能,并提供了一个单一的框架来表示天然和合成、线性和非线性大分子。

image.png

图1 大分子的图表示


利用这种独特的表示方式,作者使用精确的GED评分与Tanimoto相似性替换矩阵,以及图核,来计算2个或多个大分子图之间的相似性(图1B)。GED通过分配节点和边替换的分数来计算两个图之间的相似度。并且使用Tanimoto相似度矩阵代替基于进化统计的替换矩阵,计算分子指纹之间的相似度(图2A,B)。为了解决计算GED成本高的问题,作者使用传播属性核来获得大型数据集的相似度矩阵。此外,作者还分析了聚糖数据集的相似性向量。在GraKeL中实现的传播属性核用于计算相似度(图2C)。该核为大分子图提供了绝佳的选择,因为它们捕获了本地节点信息并沿边缘迭代地传播了这些信息。以这种方式,核捕获了大分子的局部单体化学和整体拓扑。

image.png

图2 聚糖具有广泛的化学相似性


作者提出降维更多地受分类学分类的影响,而不是免疫原性的影响。在图2D中,作者按域着色绘制,可以观察到域的排列与进化过程相似,从中心的细菌开始,然后是真核生物,然后在边缘出现病毒,可以看出,免疫原性是属于特定结构域的聚糖的结果,例如细菌具有免疫原性。


实验


作者针对指纹,one-hot节点和边属性训练了5种GNN模型架构,以针对免疫原性和8个分类标准对聚糖进行分类。对于每个任务,作者评估了分类指标,该分类指标通过对至少具有5个随机初始化种子的前5个超参数集重新训练的模型进行平均化获得(表1)。实验表明,该模型获得了最好的结果,并且表现优于文献报道的指标。


表1 在测试数据集上获得最佳模型属性组合的度量

image.png

总结

大分子图表示与分子指纹、图相似性和GNN相结合,提供了一个表示、计算相似性和机器学习大分子的框架。这项工作为大分子的计算研究提供了一种化学方法。在不久的将来,作者将在包括蛋白质和DNA / RNA在内的各种大分子数据集上验证该模型的适用性。

目录
相关文章
|
Web App开发 前端开发 Java
SpringBoot默认200个线程对于Websocket长连接够用吗?(一)
上篇推文从源码剖析SpringBoot中Tomcat的默认最大连接数中我们知道,SpringBoot的内嵌Tomcat默认的最大连接数为200。那么,这个默认值对于项目中引入了WebSocket使用长连接后,是否足够用呢?今天强哥就带大家一起从源码的角度来分析一下。
SpringBoot默认200个线程对于Websocket长连接够用吗?(一)
|
缓存 图形学
游戏通用解决方案之红点设计
游戏通用解决方案之红点设计
1494 0
|
1月前
|
人工智能 IDE 自动驾驶
GitHub Copilot CLI 上手指南(面向 Claude Code 深度用户)
适用版本:Copilot CLI 1.0.69 | 整理日期:20260709![封面](https://oscimg.oschina.net/oscnet/up088cf4c72af4a2960caecb7d4fa9ef4b97e.jpg) 一、安装 Copilot CLI前置条件:Node.j
784 9
GitHub Copilot CLI 上手指南(面向 Claude Code 深度用户)
|
机器学习/深度学习 数据采集 TensorFlow
使用Python实现智能食品加工优化的深度学习模型
使用Python实现智能食品加工优化的深度学习模型
696 59
养龙虾不破产,OpenClaw 三种使用技巧,降低 Token 消耗
这是一份OpenClaw降本增效实战指南,聚焦三大核心:①斜杠命令(/compact、/reset、/new)秒级优化对话长度;②多Agent分工实现上下文隔离与故障可控;③memory-search机制以查代记,精准调用长期知识。三法协同,直击Token浪费与响应迟缓痛点。(239字)
|
消息中间件 canal 缓存
项目实战:一步步实现高效缓存与数据库的数据一致性方案
Hello,大家好!我是热爱分享技术的小米。今天探讨在个人项目中如何保证数据一致性,尤其是在缓存与数据库同步时面临的挑战。文中介绍了常见的CacheAside模式,以及结合消息队列和请求串行化的方法,确保数据一致性。通过不同方案的分析,希望能给大家带来启发。如果你对这些技术感兴趣,欢迎关注我的微信公众号“软件求生”,获取更多技术干货!
831 6
项目实战:一步步实现高效缓存与数据库的数据一致性方案
多进程同步之文件锁
【10月更文挑战第16天】文件锁是一种常用的多进程同步机制,它可以用于确保多个进程在访问共享资源时的互斥性。在使用文件锁时,需要注意锁的粒度、释放、竞争和性能等问题。通过合理使用文件锁,可以提高多进程程序的正确性和性能
|
SQL 关系型数据库 MySQL
OceanBase 的 SQL 兼容性与优化
【8月更文第31天】随着分布式计算的发展,越来越多的企业开始采用分布式数据库来满足其大规模数据存储和处理的需求。OceanBase 作为一款高性能的分布式关系数据库,其设计旨在为用户提供与传统单机数据库类似的 SQL 查询体验,同时保持高可用性和水平扩展能力。本文将深入探讨 OceanBase 的 SQL 引擎特性、兼容性问题,并提供一些针对特定查询进行优化的方法和代码示例。
1287 1

热门文章

最新文章