贝叶斯引导的开放域分子/蛋白搜索
推荐指数 69.0 NO. 024 · 2026.08.19
upvotes47comments2
为什么值得看
提出Large Discovery Model,将生成式模型与贝叶斯非参数奖励代理结合,在分子、蛋白质和程序空间进行不确定性感知的开放域搜索。对做AI for Science的团队,这是把LLM的生成能力和贝叶斯优化的样本效率真正缝合起来的框架,可能替代传统的高斯过程+进化算法组合。
媒体预览
编辑判断
这个工作的关键突破在于用贝叶斯非参数方法替代了LLM自带的不可靠置信度,解决了生成模型在分布外候选上"盲目自信"的老问题。之前做分子发现的主流是GA+D+结合GP-UCB或者进化算法,样本效率低;纯LLM方法如ProGen虽然生成能力强但缺乏系统性的探索机制。这篇论文把两者拧在了一起,reward surrogate用BNP可以自动适应假设空间的复杂度,不需要预设核函数。论文提到覆盖了分子、蛋白、程序三个域,但没看到开源代码和具体的实验预算数字,这是落地前最需要确认的两件事。如果你在做湿实验预算有限的药物发现团队,建议等代码释放后优先在分子性质预测任务上复现,对比下和TDC benchmark上现有方法的样本效率差距。
相关内容