Agent Plan × DeepSeek Harness:分子逆向设计从性能到结构的推理链

摘要:分子逆向设计的目标,是从"目标性能"反推"分子结构"。这一命题在传统计算化学中受制于化学空间的组合爆炸与性能-结构映射的不可微性,长期停留在局部搜索。大语言模型(LLM)与智能体(Agent)技术的成熟,为这道难题提供了一条全新的工程化路径:以 Agent Plan(任务规划中枢)组织研究流程,以 DeepSeek Harness(深度推理与工具编排控制框架,取"deep seek"本义,兼指以 DeepSeek-R1 为代表的推理时计算范式)封装领域工具与验证闭环。本文从问题本质出发,梳理分子逆向设计四代范式的演进逻辑,剖析 Agent 规划层与控制层的设计要点,给出"性能 → 结构"端到端推理链的完整拆解,并结合 CAi Copilot、ChemCrow、Coscientist、S1-MatAgent、Llamole、MEMOS 等真实系统与文献数据,讨论工程落地中的关键挑战与自主科学(Self-driving Science)的演进方向。


引言:当"设计"变成一道规划题

材料与药物的研发史上,最昂贵的动作是"试错"。一个类药分子要同时满足活性、选择性、代谢稳定性、溶解度、毒性等十余项性质,而类药化学空间的规模在 10^60 量级——比可观测宇宙中的原子数目还要多出若干数量级。传统研发流程本质上是在这个近乎无限的空间里做"带约束的随机行走":先凭经验选定母核,再围绕少数几个位点做取代基扫描,测一批、改一批。工业化高通量筛选(HTS)把这一过程放大了若干个数量级,但"先造出来、再测好坏"的 正问题逻辑 没有改变——探索成本与化学空间的规模成正比。

这正是"逆向设计"(Inverse Design)登场的背景:我们希望直接指定目标性能(比如"在 420 nm 处发射、半峰宽小于 25 nm、且能真空蒸镀的有机发光分子"),让算法自动给出满足条件的分子结构。2016 年以来的深度生成模型(VAE、GAN、扩散模型、强化学习)证明了一条可行路径:让模型在结构空间里"采样",再用正向预测器筛选,形成"生成-评估-再生成"的闭环。

但生成模型只是替换了"结构怎么来",并没有回答更本质的问题:这个研究过程本身由谁来组织? 一个真实的设计任务包含目标澄清、约束解析、数据获取、生成策略选择、多目标权衡、合成可行性核查、失败归因、方案迭代……每一步都需要领域知识,且步骤间存在复杂的依赖与分支。2023 年底以来,以 ChemCrow、Coscientist 为代表的科学智能体(AI Agent for Science)给出新的答案:把"设计研究"本身当作一个可以由 LLM 驱动的规划问题——LLM 不再只负责生成分子,而是负责"决定下一步做什么、调用哪个工具、如何解释结果"。

本文标题中的两个关键词由此而来:

  • Agent Plan——规划的"大脑皮层"。研究任务的分解、排序、分支、重规划,都以显式规划(Explicit Planning)的形式存在于 Agent 的推理循环中,而非隐式地散落在算法的超参数里。
  • DeepSeek Harness——执行的"神经与肌肉"。将深度推理(推理时计算、思维链展开)、深度搜索(对候选空间的树搜索/束搜索)、工具编排(MCP 协议、领域工具包)与验证反馈(模拟器、AI 预测器、真实实验)封装为一套可复用的控制框架(Harness),让"深度"不再是模型的静态能力,而是 Agent 在任务过程中可以主动投入的可变计算预算

下文将沿一条主线展开:问题本质(为什么难)→ 范式演进(从筛选到生成到自主)→ 规划层设计(Agent Plan)→ 控制层设计(DeepSeek Harness)→ 端到端推理链全貌 → 案例解剖 → 工程挑战 → 未来图景


第一章 问题本质:逆向设计为什么"难"

1.1 组合爆炸:化学空间不是"大",而是"不可穷举"

分子结构的离散组合性决定了逆向设计的第一个困难。以有机分子为例,仅考虑 C、N、O、S、P、卤素等常见元素,小分子药物相关空间即达 10^60 量级;若加入金属有机配合物、高熵合金、聚合物与二维材料,构型空间呈超指数增长。2025 年 5 月劳伦斯伯克利国家实验室与 Meta AI 联合发布的 Open Molecules 2025(OMol25,含逾 1 亿个分子动力学模拟快照)看似规模惊人,相比全空间仍是沧海一粟。

推论:任何"枚举式"方法——包括高性能虚拟筛选——都会撞上算力墙。唯一的出路是引导式搜索:让采样分布跟随目标性能不断收缩。这正是生成式方法的理论基础,也是"正问题求解器必须与生成器耦合"的结构性原因。

1.2 双鸿沟:性能-结构的映射是"多对一"且"强耦合"

逆向设计第二个困难来自物理本身:

  1. 多对一映射:同一宏观性能(如带隙、玻璃化转变温度、细胞穿透率)可以由截然不同的微观结构实现,反之,两个只差一个甲基的分子可能表现出数量级的活性差异。正问题(结构 → 性能)是多对一、非线性的;其逆问题(性能 → 结构)则天然是病态逆问题(ill-posed)——解不唯一,且不连续。
  2. 多性质强耦合:真实需求从来不是单目标。药物要"活性高且毒性低且可合成",发光材料要"色纯度高且效率高且热稳定"。这些性质之间常呈 Pareto 冲突(提升一个通常牺牲另一个),因此在"性能空间"里根本不存在唯一正解,只有权衡前沿(Pareto Front)

推论:逆向设计本质上不是"求逆",而是带约束的多目标搜索。因此评估一个算法体系,不能只看"能否生成符合要求的结构",更要看它能否在尽量少的评估次数内逼近 Pareto 前沿。

1.3 验证成本:评估是最贵的资源

无论是 DFT 计算、MD 模拟还是湿实验,对候选结构做一次可靠的性能评估都远比"生成一个结构"昂贵——时间上跨越毫秒(AI 预测)到分钟(DFT)到天(实验)。传统优化算法(遗传算法、贝叶斯优化)之所以在分子领域举步维艰,是因为它们的评估预算极其有限,而随机初始化又往往落在性能很差的区域。

推论:任何一种可行架构,都必须把"评估预算"当作第一资源来管理。由此引出后续所有设计的上帝视角:生成器负责提出候选,代理模型负责廉价预筛,昂贵验证只留给少数高置信候选,Agent 负责决定"谁值得被验证、何时验证、验证后怎么改"

1.4 知识图谱的碎片化

领域知识散落在异构的载体中:教科书(定性规律)、数据库(结构化数据,如 PubChem、Materials Project、ChemSpace)、文献(非结构化文本)、代码(RDKit、Psi4、VASP 的工具能力)、以及研究者脑中的经验(无法显式编码)。没有任何单一模型能端到端覆盖全部知识。

推论:面向逆向设计的 AI 系统必须是工具化、插件化的——把知识封装进可检索、可调用、可验证的工具接口,由规划器按需组合。这正是 Agent 范式相对于"一个模型打通关"范式的结构性优势。

本章小结:逆向设计的难点不是"没有解",而是"解空间的形状未知、评估昂贵、约束冲突"。这决定了任何有效方案都必须同时具备三件事:强生成能力(在约束下采样)、廉价评估能力(代理模型)、策略能力(决定下一个动作)。传统方法解决前两件,Agent 范式第一次把第三件——策略能力——提到了架构中心。


第二章 四代范式:从"筛选"到"自主发现"

理解 Agent + 深度推理在逆向设计中的位置,需要先看清这条技术路线的演进坐标。Nature Materials 2025 年综述《AI-driven approaches for materials design and discovery》系统总结了这一历程:从高通量正向机器学习、进化算法,到强化学习与深度生成模型,再到当下的智能体驱动范式。我们把它归并为四个代际:

第一代
高通量筛选
正向ML排序
算力换覆盖

第二代
深度生成模型
VAE/GAN/扩散
结构空间采样

第三代
生成+优化闭环
RL/贝叶斯
Pareto多目标

第四代
自主Agent
规划-执行-验证
工具编排+推理时计算

进化方向
L4全自主科学伙伴

第一代:高通量虚拟筛选。 建立"结构 → 性质"的正向代理模型(从力场、DFT 到机器学习势函数),对预构建的候选库做批量打分取前 N 名。代表作如 2018 年 npj Computational Materials 上的深度逆设计模型:以光吸收波长为目标训练 VAE 风格编码器-解码器,命中率达到 45%-83%(放宽 ±50 nm 后升至 80%-96%),并能合成出训练集中不存在的方酸菁类染料母核。第一代的局限是依赖候选库的覆盖度——库外结构永远不可能被"发现"。

第二代:生成式逆向设计。 把生成器接到目标条件上:条件 VAE、GAN、自回归 SMILES 模型、图生成模型、扩散模型逐一登场,让模型直接"产出"满足条件的结构,而不是从库里"挑"。MIT 的 Llamole 系统是这一代的集大成者之一:它把 LLM 当作门控核心,用"design"触发 token 切换到一个图扩散模型去画分子骨架,用"retro"触发 token 切换到图反应预测器去做逆合成规划——语言模型与图模块形成"交替生成"的混合架构。生成式方法的突破在于走出了训练集,但"生成什么"仍然只由训练分布与条件向量决定,缺乏对评估结果的显式反思。

第三代:生成 + 显式优化闭环。 引入强化学习(RL)、遗传算法(GA)、贝叶斯优化作为外环,用正向预测器的分数对生成器做显式奖惩。典型案例:MEMOS 框架(Digital Discovery, 2025)用马尔可夫分子采样搭配多目标优化,针对窄带发光分子做逆向设计,数小时内遍历数百万结构、定位数千个目标分子,经 DFT 验证的成功率高达 80%,且能够回放文献中已知的多共振核心并拓展色域。MgH2 储氢催化剂工作(Journal of Magnesium and Alloys, 2026)也展示了"GPT-4o 构建数据集 + ML 预测模型 + 遗传算法逆向设计"的组合拳,还从 GA 结果中提炼出"多金属协同、先进载体"等可与 2025 年实验文献互证的设计原理——这意味着优化器输出的已不止是分子,还有可迁移的知识。第三代的问题是流程是线性的、预设的:评估函数、融合权重、迭代次数全部写死,遇到矛盾信号(预测与实验背离、搜索陷入局部最优)时,系统没有自主应对的能力。

第四代:自主 Agent。 2024 年 ChemCrow 与 ORGANA 率先把"设计-合成规划-实验执行"串成由 LLM 协调的流水线;2025 年中国科学技术大学的 ChemAgents(JACS 发表)把多智能体系统与机器人化学家结合,实现"开放式指令 → 按需任务编排";上海人工智能实验室与南京大学的 CAi Copilot 则聚焦早期小分子设计,把"研究者意图 → 可执行科研流程 → 证据整理"全线自动化:在 45 项任务(CAiMD)上总体目标满足度达 84.59%(领先第二名 18.07 个百分点),有效工具输出率 67.49%(比最佳对照高 32.58 个百分点),在 SMDD-Bench 上将先导优化成功率从 50% 提升到 63.3%。

四代演进的关键变量,不是模型参数,而是**“搜索的控制权"逐步从流程脚本移交给了推理主体**:第一代控制权在候选库,第二代在生成分布,第三代在优化算法,第四代在 Agent 的规划循环。这一转移带来两个质变:其一,失败可以被解释——Agent 能对结局做归因并据此改写策略;其二,评估预算可以被动态分配——Agent 决定"这个问题用廉价的 AI 预测器还是昂贵的高保真计算,甚至上机器人实验台”。


第三章 Agent Plan:分子设计中的"规划中枢"

3.1 为什么规划是必需品

生成模型回答"下一步生成什么分子",优化算法回答"往哪个方向调",而规划层回答的是"整个研究流程该怎么走"——这是更高一层的递归问题。以"设计一款钙钛矿空穴传输材料"为例,完整的任务图包含:检索文献与已知材料 → 定义目标性质集合(带隙、迁移率、成膜性、稳定性)→ 选定生成引擎(VAE?扩散?GA?)→ 设计候选批次 → 用代理模型预测 → 对冲突指标做权衡(Pareto 分析)→ 合成可行性检查(逆合成 + 试剂可得性)→ 对幸存者做高保真验证(DFT/MD)→ 汇总证据、输出报告。任何一个环节在真实执行中都可能冒出分支:数据库查不到某性质就换预测模型;预测结果方差太大就回退到更保守的假设;DFT 不收敛就修几何初始化后重跑。

传统软件工程用手写管线(pipeline)解决这类问题,但研究任务与业务任务的根本区别在于不确定性密度:研究中的每个节点都可能失败、都可能产生意外信号、都可能需要临时插入新步骤。手写管线无法预埋所有分支。Agent Plan 的核心主张是:把流程控制权交给一个能读文本、能推理、能调用工具的规划器,让流程图在运行时动态生长——这正是"动态 DAG 工作流"的含义:每个任务是一个节点,节点间依赖与条件逻辑(“如果形成能 > 0 则终止该掺杂路径,否则继续电子结构计算”)由规划器即时生成。

3.2 规划循环:ReAct 与 Plan-and-Execute 的再思考

Agent 规划最基本的形态是 ReAct 循环:思考(Thought)→ 行动(Action)→ 观察(Observation)→ 再思考。在分子逆向设计语境下,ReAct 的每一步都要与领域工具绑定:Thinking 产出以 SMILES、晶格参数、任务描述为载体的中间决策,Action 触发工具调用,Observation 带回机器可读的结构化结果(性质数值、误差、警告)。

ReAct 的优点是灵活,缺点是在长链条任务中容易"走一步看一步",缺乏全局视野,token 消耗与上下文膨胀随步数线性恶化。因此实践中更常用两级规划架构(Plan-and-Execute + ReAct 混合):

  1. 粗粒度计划(Plan):规划器把"目标性能陈述"分解为有序子任务清单,并预估每个子任务的输入输出契约(用什么工具、产出什么格式、依赖哪些前置步骤)。
  2. 细粒度执行(Execute):每个子任务内部仍然走 ReAct 循环,直到该子任务完成或证据冲突触发重规划。

阿斯利康的 ChatInvent 系统提供了宝贵的工程实证:其早期 LangChain 原型对比了 ReAct 与 Structured Chat 两种结构,发现 ReAct 在化学任务里更容易出现参数格式错误、输入类型不匹配,最终选用更稳定的 Structured Chat;而当系统规模扩大后,单智能体的上下文膨胀与路由不稳定迫使团队转向 LangGraph 多智能体架构。这条"单智能体 → 多智能体"的演进路径几乎是所有真实系统的共同轨迹,因为它揭示了一个统计规律:随着工具与任务类型增多,单一上下文窗口难以同时容纳"全局记忆 + 工具 schema + 中间结果",把不同职责解耦到独立上下文是工程上几乎必然的选择。

分解并分发

分解并分发

分解并分发

分解并分发

结果回传

结果回传

结果回传

证据回传

不满足则重规划

监督Agent(Plan)

Design Agent
分子生成与评分

Synthesis Agent
逆合成与反应搜索

Utility Agent
SMILES校验/转换

Analyzer Agent
数据处理与证据整理

生成引擎:REINVENT/Mol2Mol/
扩散模型/GA

逆合成引擎:AiZynthFinder/
反应模板库

RDKit/PubChem
结构校验数据库

统计模型/可视化
Pareto分析

3.3 多智能体编排范式

当前科学 Agent 的多智能体编排大致分三种模式:

  • 监督式路由(Supervisor Routing):一个监督 Agent 统一入口,识别任务类型后分发给专家子 Agent。ChatInvent(Design/Synthesis/Utility/Analyzer 四子体)、MatSciAgent(主 Agent + 数据检索/晶体结构生成/连续介质模拟/MD 模拟子体)都属此类。其关键在于监督 Agent 要能生成"明确、范围受限的子任务描述",避免把模糊指令下传给子体。
  • 规划者-执行者(Planner-Executor):S1-MatAgent 为代表。Planner 动态分解复合设计任务并配置专用工具,Executor 执行。S1-MatAgent 借此完成了高熵合金析氢催化剂的全周期逆向设计:从 2000 万候选空间收敛到 13 个高性能催化剂,其中 Ni4Co4Cu1Mo3Ru4 过电位低至 18.6 mV,整体性能较基线提升 27.7%。
  • 自由协作(Peer Collaboration):多个对等 Agent 通过共享黑板/消息总线协商分工。优点是小任务无需路由开销,缺点是职责边界易漂移,目前在分子设计领域尚以学术探索为主。

3.4 规划层的评估机制

规划的"好坏"不能只看最终产物,还要看过程的证据质量。CAi Copilot 的设计为此提供了可操作指标:目标满足度(plan 的执行结果与用户目标的符合程度)、有效工具输出率(调用工具后是否产生可用的结构化结果)、证据链完整性(结论能否回溯到每一步工具输出)。这些指标的价值在于让"规划质量"变得可评测、可回放、可优化——这是 Agent 系统走向生产的先决条件。

本章小结:Agent Plan 不是"让 LLM 写一段工作计划",而是把任务分解、工具接入、分支处理、证据管理、失败归因做成显式的运行时机制。多智能体是规模化的必然形态,监督式路由与 Planner-Executor 是当前最成熟的两条工程路径。


第四章 DeepSeek Harness:把"深度"做成可调度的资源

4.1 语义厘清:何为"DeepSeek Harness"

本文的 DeepSeek Harness 是一个复合概念,取其字面双关:

  • deep seek(深度搜寻):指 agent 在任务中投入的可变推理计算量(Test-Time Compute)与定向搜索过程——以 DeepSeek-R1、OpenAI o 系列为代表的推理模型通过强化学习训练出原生思维链,在数学、代码、科学推理任务上实现数量级提升;而"深度搜索"则指在分子树/图空间上展开的束搜索、Beam Search、蒙特卡洛树搜索(MCTS)等显式搜索过程。两者的共同点:深度 = 在关键决策点多花计算,而不是均匀地烧算力
  • Harness(控制装置):指把上述推理能力与领域工具、数据库、验证器封装起来的编排框架——类似软件工程里的 test harness / agent harness:模型是引擎,Harness 决定引擎何时启动、挂载哪些工具、以什么协议通信、如何把输出规范化为可验证的格式。

一句话概括:Agent Plan 决定"做什么、按什么顺序做",DeepSeek Harness 决定"每一步怎么做深、怎么调用工具、怎么保证结果可信"。

4.2 推理时计算的三种打开方式

推理时计算在分子逆向设计中有三种落点:

其一,长链推理(Chain-of-Thought with Verification)。 ChemCrow 的实践表明,纯 LLM 在精确化学事实上不可靠——分子量算错、官能团识别张冠李戴是常态。对策是"不依赖记忆、只依赖工具":LLM 作为管理者,在生成合成计划前先查询经过验证的数据库(RDKit 计算、PubChem 检索、GHS 安全检查),把推理的每一个数值断言都接地到工具输出上。推理时计算的真正价值由此显现:把模型的一次性"记忆检索"替换为多轮的"检索-计算-验证",可靠性从模型先验水平跃迁到工具精度水平。

其二,分支搜索(Search over Alternatives)。 在逆合成规划中,每一步反应通常有多个候选模板与多条可行路线。把每一步展开成搜索树节点、用深度优先或束搜索遍历,并在叶子节点做可合成性打分——这一范式(AiZynthFinder 等)早已证明比贪心单路径可靠得多;把它装入 Agent 后,规划器可以用 LLM 的化学直觉来裁剪搜索树(优先展开"符合目标官能团策略"的支路),实现"经验剪枝 + 暴力遍历"的混合搜索,兼顾效率与完备性。

其三,自我反思与重规划(Self-Reflection / RSI)。 2025 年的 RSIAgent 等工作展示了一个重要规律:不更新模型参数,Agent 也能通过自主探索与记忆演化持续突破底层模型的原始能力边界(在 OSWorld 2.0 上从 71.97% 提升到 78.98%)。映射到分子设计场景:Agent 可以把"上一次设计失败的原因"(如:忽视溶解度约束、候选分子合成难度过高)写入结构化记忆,在下一次规划时显式规避。这种跨任务经验迁移,是传统优化算法很难具备的。

DeepSeek Harness 控制框架

反馈信号

推理引擎
思维链/反思/重规划

工具网关
MCP协议/工具选择/参数校验

搜索调度
束搜索/MCTS/裁剪策略

结构化记忆
失败归因/经验库

验证器栈
规则校验/代理模型/DFT/实验

4.3 工具网关:MCP 与领域工具生态

工具层是 Harness 的身躯。以 ChemCrow 的工具集为参照样本,一个完整的分子设计 Harness 至少需要五类工具:

  1. 结构工具:SMILES 解析/校验、分子量、官能团识别、立体化学处理(RDKit 体系);
  2. 性质计算工具:logP、TPSA、溶解度预测、ADMET 代理(PIP 类平台);
  3. 生成与搜索工具:REINVENT/Mol2Mol 分子生成、AiZynthFinder 逆合成、反应模板库、ChemSpace 类组合库检索;
  4. 数据工具:PubChem、Materials Project、MatWeb 等数据库检索,专利状态检查,文献挖掘(LitSearch);
  5. 安全与合规工具:GHS 危害检查、毒性预测、合成安全评估。

Anthropic 于 2024 年 11 月开源 MCP(Model Context Protocol)后,工具接入从"每家一套私有胶水"走向"USB-C"式标准化。对科学 Harness 而言,MCP 的意义不只是省了接入成本,更重要的是让工具以统一 Schema 暴露"输入-输出契约"——这正是第三章强调的规划器生成子任务描述的前提:只有当工具契约是机器可读的,规划器才能可靠地做参数装配与错误恢复。

4.4 验证器栈:把"信心"拆成可核验的层次

DeepSeek Harness 最容易被低估的组件是验证层。分子逆向设计的验证天然存在保真度阶梯(fidelity ladder),Harness 的职责是按预算与风险分配验证层级:

  • L0 规则校验:价键合法性、SMILES 可解析性、违反泛式规则(如 Lipinski、PAINS 过滤),毫秒级;
  • L1 机器学习代理:GNN/Transformer 性质预测器,秒级,覆盖 logP、溶解度、活性等;
  • L2 高保真计算:DFT(带隙、激发态能级)、MD(扩散系数、玻璃化温度)、ML 势加速的动力学,分钟到小时级;
  • L3 物理实验:机器人平台合成与表征(Coscientist、ChemAgents 的实验室闭环),天级。

一个成熟的 Harness 会把"分层验证"做成隐式路由:候选分子先过 L0/L1 海选,幸存者进入 L2 精筛,最后只有极少数进入 L3。验证层之间的信号冲突(如 L1 说活性高、L2 说激发态不稳定)正是触发 Agent 反思与重规划的最强信号——这是生成-优化闭环与 Agent 闭环的根本差异:前者把冲突当作噪声,后者把冲突当作信息。

本章小结:DeepSeek Harness = 深度推理(何时多算)+ 深度搜索(在哪展开)+ 工具编排(如何调)+ 验证闭环(凭什么信)。四者共同把"深度"从模型的静态属性变成 Agent 可动态调度的资源——深度本身成为 Agent Plan 的一项调度变量:重要节点加深推理,平凡节点快速通过。


第五章 从性能到结构:端到端推理链全貌

现在把 Agent Plan 与 DeepSeek Harness 合流,给出分子逆向设计的完整推理链。这条链以"目标性能陈述"为输入,以"可合成、可验证的候选结构 + 证据报告"为输出,共七个环节,环环之间存在分支、回退与数据回流:

候选不达标或信号冲突

证据不足需补数据

推荐优先级调整

实证通过

环节1 目标性能定义
用户意图→可度量指标

环节2 约束编码
化学空间/预算/安全边界

环节3 分子生成
扩散/VAE/GA/LLM混合

环节4 正向预测
L0规则→L1代理→L2高保真

环节5 多目标评价
Pareto权衡/评分融合

环节6 合成可行性
逆合成+试剂可得性

环节7 闭环验证

交付:候选结构+证据链

环节 1:目标性能定义(Goal Formalization)

推理链的起点是把模糊的用户陈述转成形式化指标。用户的真实表达往往是"想要一种水溶性好又能穿透血脑屏障的抑制剂"“想要窄带隙的红色发光材料”。LLM 在此环节负责语义翻译与指标补齐:从自然语言中抽取性质约束(水溶性 → logS ≥ -4;血脑屏障 → logP 区间 + TPSA 上限),并提示用户补充缺失维度(是否要求合成简单?是否限制成本?是否考虑毒性?)。Llamole 的"门控 LLM"正是这一环节的工程化:它把用户查询解析成结构化条件,再据此触发相应的图模块。

该环节的产出物是一份机器可读的目标规格书(spec):性质名、目标区间、权重、约束类型(硬/软)、验证方法。规格书是整个链条的"宪法"——后续所有环节的裁决都以它为锚,任何与规格书冲突的信号都必须显式上报,而不是被静默吞掉。

环节 2:约束编码(Constraint Encoding)

约束分为四类,进入生成器的路径各不相同:

  • 硬化学约束(价键、原子类型、骨架类型、禁止官能团):直接写进生成器解码逻辑或图编辑操作(masking),保证 100% 满足;
  • 软性质约束(logP、TPSA、溶解度阈值):编码为条件向量或奖励函数项;
  • 搜索预算约束(候选数量、评估次数、计算时间):进入 Harness 的调度器,决定每层验证的采样比例;
  • 安全与合规约束(PAINS 过滤、专利状态、毒性上限):放在验证器栈的最前端(L0),一旦违反直接淘汰,不浪费后续预算。

约束编码的质量直接决定后续效率:经验表明,在生成端硬编码、在评估端软编码、在验证端强过滤的三段式布局,优于"全部塞进奖励函数"的单一方案。

环节 3:分子生成(Generation)

生成器的选择由规划器按化学空间类型动态决定:

  • 药物小分子:SMILES 自回归模型(REINVENT/Mol2Mol)、图扩散模型(Llamole 的 graph module)、条件 GAN 均可;倾向平滑、高覆盖率。
  • 晶体/合金材料:晶格与组分组合优化,常用遗传算法 + 局部梯度(S1-MatAgent 的 27.7% 性能提升即来自"生成-梯度优化"桥接,弥补生成器与目标之间的 gap);
  • 发光/光电分子:马尔可夫分子采样 + 多目标优化(MEMOS)在窄带发射体逆向设计上验证了效率(数小时遍历数百万结构)。

关键设计点是多样性-相关性平衡:纯由目标条件驱动的生成会迅速坍缩到有限骨架簇,丧失空间探索能力;纯随机的生成则浪费时间预算。工程解是"epsilon 探索 + 重放缓冲区":Agent 生成时按概率混入历史高分区候选的变异与随机骨架跳跃,并定期把"当前 Pareto 前沿附近"的分子回炉重组。

环节 4:正向预测(Forward Prediction)

正向预测是逆向设计的"眼睛",其架构直接决定推理链的可靠性。推荐的分层策略已在 4.4 节详述;这里补充两个实战要点:

代理模型的不确定性必须被显式携带。用 GNN 预测器的均值作为筛选依据是不够的——当候选分子落在训练分布边缘(新颖骨架)时,预测方差可能非常大。因此 Agent 的决策逻辑不是"选分数最高的",而是"选**下界置信(lower-confidence bound)**最高且有探索价值的"(类 UCB 策略),并将高不确定性候选路由到更高保真层级补测而非直接淘汰。

多保真度融合(multi-fidelity)。同一性质往往有多个精度的预测器(如 logP 的半经验法 vs QM 计算 vs 实验值),Harness 应按"候选重要性"动态选择精度,用贝叶斯多保真优化把昂贵高保真评估的调用次数压到最低。这与 Active Learning 的查询策略同构——评估预算越贵,查询策略越要聪明

环节 5:多目标评价(Multi-objective Evaluation)

真实设计几乎总是多目标。两个子问题必须解决:

  1. 标准化与加权:不同性质量纲不同(logP 的 -1 到 5,活性的 nM 到 µM),需用分位数或满意度函数归一;权重来自环节 1 的规格书,但应支持在迭代中由用户/Agent 调整。
  2. Pareto 前沿显式化:与其把多目标压成单分数,不如直接维护当前非支配解集(Pareto Archive)。Agent 向用户交付的不是"一个最优分子",而是前沿上的一组候选 + 每位的取舍说明(“A 溶于水但活性略低,B 活性高但难合成”)——让科学判断留在人机协同层,而不是被评分函数悄悄替掉。

环节 6:合成可行性(Synthesizability)

"设计出来但造不出来"是逆向设计最常见的失败模式。该环节由 Synthesis Agent 承担:对每个候选做逆合成分析(AiZynthFinder 类引擎),输出完整路线图、每步反应模板置信度、所需试剂可得性/价格,并可调用 Precedent Finder 检索相似反应文献证据。对路线太深(> 8 步)或含稀有试剂的候选,可按预算做"虚拟合成"降级或退回环节 3 重新生成。合成可行性不应是末端一刀切,而应作为奖励项回传生成器——例如在 REINVENT 的评分函数中乘上可合成性项(SA score / 逆合成成功率的代理),让生成分布从一开始就避开难合成的区域。

环节 7:闭环验证与数据回流(Closed-loop Validation)

最后一个环节是整套系统的"价值兑现点",也是 Agent 范式相对传统管线的分水岭:

  • 虚拟验证:L0-L2 逐级通过后,候选进入高保真计算(DFT/MD)。信号冲突(预测与高保真计算背离)触发归因:是代理模型不准(→ 更新代理模型、扩充训练数据)?是约束设置不当(→ 退回环节 2)?是生成空间覆盖不足(→ 调整环节 3 的探索参数)?
  • 物理验证:接入机器人平台(Coscientist、ChemAgents、ORGANA 模式)后,幸存候选进入真实合成与表征。实验产物数据回流到两类目标:① 代理模型的再训练集(数据飞轮);② Agent 的结构化记忆(沉淀"这类骨架的电子效应规律"等经验)。
  • 人机交接:Agent 输出最终交付物——候选结构、完整证据链(每项结论回溯到工具输出与数据)、失败案例与原因分析、以及"如果继续投入,建议优先验证哪些方向"。

这条推理链的元规律是:每一个环节都产生可解释的中间产物,每一个回退都有明确的触发条件与归因对象。 这正是它区别于"黑盒生成器 + 黑盒评分器"之处——可解释性是 Agent 系统在科学场景中赢得信任的唯一途径。

本章小结:七环节推理链把"从性能到结构"从一句口号变成了可工程化的流水线。规划层决定链路走向,控制层决定每步深度,验证层决定哪些信号值得相信,数据回流让整条链随使用而变强。


第六章 案例解剖:五个系统,五种设计哲学

把前文的框架投射到真实系统上,能立刻看出各家在"规划层 × 控制层"两种维度上的不同取舍。下表先用一张总览图收拢关键系统,再逐个解剖设计哲学:

系统组织者生成引擎验证方式覆盖环节标志性结果
ChemCrow单 LLM AgentRDKit + 逆合成工具工具接地(无实验闭环)1/2/3/618 种专家工具,解决 LLM 化学事实不可靠问题
Coscientist单 LLM Agent代码执行 + 实验平台L0-L3 全通(机器人实验)1-7自主优化钯催化交叉偶联反应
CAi Copilot三层结构 Agent分子生成 + 多目标筛选AI 预测 + 证据整理1-5/7目标满足度 84.59%,先导优化成功率 +13.3pp
S1-MatAgentPlanner-Executor 多体GA + 梯度桥接计算验证1-7(虚拟域)2 千万候选 → 13 个高熵合金催化剂,性能 +27.7%
MEMOS无 Agent,纯采样优化框架马尔可夫分子采样DFT 验证2/3/5窄带发光体逆向设计成功率 80%

6.1 ChemCrow:工具接地的先行者

ChemCrow 的历史意义不在于生成能力,而在于确立了"LLM 不可靠,那就让 LLM 学会不依赖记忆"这一原则。它把 18 个经过验证的专家工具(文献挖掘、GHS 安全检查、RDKit 性质计算、专利检索)挂到 LLM 的推理循环下,让每一次数值断言都来自工具输出。它的局限同样清晰:工作流大体线性、任务特定,缺少自动解析实验反馈并发起迭代优化的分析模块——研究循环是"开环"的。这提醒我们:工具接地是必要条件,但只有配上闭环反馈,才能从"可靠的规划"走向"自主的发现"。

6.2 CAi Copilot:把"可解释"做成产品

上海 AI 实验室与南京大学 2025 年 8 月发布的 CAi Copilot,是把"可解释的科学 Agent"做成工程产品的代表。其三层架构值得一提:

  • Research Interface(研究接口):把研究者的设计意图转译成可执行、可追踪的科研流程,是"人机协同"的入口;
  • Agent Reasoning(推理层):负责分子生成、筛选、多目标评价的决策逻辑;
  • Execution Substrate(执行底座):承载工具执行与结果落地,保证每一步可回放。

评价指标(目标满足度、有效工具输出率、证据链完整性)使"规划质量"从口号变成可评测的工程指标。45 项任务上 84.59% 的目标满足度、SMDD-Bench 上先导优化成功率从 50% 提升至 63.3%,是当前公开数据中最强的早期小分子设计 Agent 战绩。

6.3 S1-MatAgent:规划者-执行者模式的全周期实证

S1-MatAgent 给行业的两点启示:

其一,动态分解的价值。它采用 Planner-Executor 架构,由自动驾驶式的 Planner 把"高熵合金析氢催化剂逆向设计"这一复合任务动态拆解为可执行子任务并配置工具,而非依赖预设流程。这意味着面对"换一个材料体系"的新任务,系统不需要重写管线。

其二,生成-优化桥接的必要性。从 2000 万候选到 13 个高性能催化剂的收敛过程中,团队采用了梯度基优化算法来弥合"设计到目标"的差距,最终 Ni4Co4Cu1Mo3Ru4 实现 18.6 mV 的过电位与优异耐久性,整体性能提升 27.7%。盲目生成+盲目筛选在巨大空间里是不够的,生成器与局部优化器必须协同——这与第五章环节 3、4 的论述互为印证。

6.4 Llamole 与 MEMOS:两个"非 Agent"参照物

把 Llamole(MIT)与 MEMOS 放进对比表,是为了划清边界:生成引擎本身的改进仍是主干竞争线。Llamole 用触发 token 机制实现"语言模型与图模块交替生成",展示了 LLM 与专用生成器"双脑协作"的优雅形态;MEMOS 证明纯采样优化框架在多目标窄带发射体设计上也能达到 80% 的 DFT 验证成功率。Agent 层提供的增量是流程组织与失败应对,而非替代这些引擎——最好的架构是"Agent 编排 + 专用生成器集群",而不是"一个 LLM 包打天下"。

6.5 自主性阶梯:四代 Agent 的坐标

把上述系统放在"自主性"维度上排序,可以得到一条清晰的阶梯(源自 2026 年科学 Agent 综述的 L1-L4 划分):

L1 AI秘书
ChemCrow
给方案,不决策

L2 AI计算搭档
ChemReasoner
看到能垒超标→生成变体重跑

L3 AI实验副手
Coscientist/ChemAgents
控制设备、实时纠错

L4 AI科学合伙人
尚未实证
自主发起研究计划

  • L1(秘书):生成候选与路线,决策权完全在人;
  • L2(计算搭档):能解读计算结果并自主发起多轮计算迭代(如根据 DFT 能垒生成电子取代基变体);
  • L3(实验副手):接入物理世界,控制微流控/机械臂,依据实时光谱信号修正实验条件;
  • L4(科学合伙人):能从多年项目数据中发现被低估的科学变量、发起全新研究计划并调度资源——至今仍是路标而非现实

这套阶梯的价值在于:它为组织规划 Agent 系统的演进路线提供了验收坐标——先做到 L1 的可靠,再追求 L2 的闭环,谨慎地逼近 L3,对 L4 保持清醒的克制。


第七章 工程落地:五个绕不开的挑战

7.1 幻觉与验证缺口

LLM 在化学事实上的幻觉无法消除,只能围堵。工程对策是双重的:推理接地(所有数值断言必须经工具验证)与输出规范化(强制结构化输出,如 SMILES 必须通过 RDKit 合法性校验、性质数值必须带单位与置信区间)。任何未经验证的输出都应默认不可信——这是 Harness 验证器栈存在的全部理由。

7.2 数据飞轮的冷启动

代理模型的质量决定整套系统的筛选用地。逆向设计场景的数据天然稀疏且偏斜:公开数据库覆盖已知空间,而最有价值的训练样本(新颖候选的实测性质)恰恰在迭代过程中才产生。这意味着系统必须内置主动学习机制,把"高不确定性但高价值的候选"优先送去实测,形成"设计→实测→再训练"的飞轮。OMol25 这类大规模公开数据集的发布降低了冷启动门槛,但领域私有数据(如药企结构的 20167 个蛋白-配体复合物贡献,将高质量预测占比从 35.6% 提升到 52.1%)仍是护城河。

7.3 可复现性与基准

科学场景对可复现性的要求远高于消费场景。Agent 系统的随机性来自三处:模型采样、工具调用顺序、搜索剪枝策略。工程对策:完整的决策日志(每个环节的输入输出、版本、随机种子)、固定工具版本与依赖、以及条件允许时对关键结论做多次重复运行的稳定性统计。基准方面,CAiMD、SMDD-Bench 等测评基准的出现是里程碑,但"任务难度分级"(如按决策深度、工具多样性分级)仍是空缺——没有难度曲线,就无法科学评估 Agent 能力的边际增长。

7.4 安全与治理

逆向设计是一把双刃剑:同一套推理链既能设计新药,也能设计化学武器前体或逃避检测的分子。安全治理应内建为架构组件而非事后审查:① 生成前拦截(禁用/受限结构库检查,类似 PAINS 但扩展至安全相关子结构);② 工具调用审计(所有合成相关工具调用留痕);③ 分级权限(危险试剂、专利敏感数据的访问控制);④ 负责任发布(高危能力默认不公开发布完整火控细节)。安全不是效率的对立面,而是长期信任的前提——一个因安全事故被叫停的分子设计 Agent 对组织的损失远大于任何效率收益。

7.5 成本与延迟的工程现实

一次完整的多智能体逆向设计可能产生数十万 token 与上千次工具调用。工程上必须区分"沙箱探索"与"生产执行":沙箱允许高成本试错,生产则通过缓存工具结果、复用计算图、预算控制器(Budget Controller)限制每环节的花费。推理时计算的"深度"应当可配置:简单任务一个 ReAct 循环结束,复杂任务才展开 MCTS——把深度当作可调旋钮,而不是默认拉满


第八章 未来图景:从"工具"到"同行者"

8.1 L4 的可行性窗口

L4(自主科学合伙人)的核心障碍不在模型能力,而在验证基础设施与科学评价体系:要让 Agent 自主发起研究计划,它必须能访问跨项目的数据资产、能评估"一个科学问题的价值"、能承担资源调度的责任。短期内更现实的路径是"L3+ 的半自主模式":Agent 自主执行、人在关键决策点(研究目标变更、资源投入、论文级结论)把关。随着机器人实验平台的成本下降(Coscientist 已证明云端实验室可行)与标准化协议(MCP、A2A)成熟,L3 的体验将逐步逼近"提交任务即可",而 L4 会在特定受限领域率先成型。

8.2 多模态与原生化:分子世界的"通用语言"

当前推理链的输入输出以文本(SMILES、自然语言)为主,正在向多模态演进:光谱数据(IR/NMR/质谱)直接作为验证信号、3D 构象与电子密度图参与推理、实验视频用于过程监控。多模态大模型(2025 年已从拼接式走向原生多模态)将让 Agent "看着光谱调反应"成为可能——这一步将显著压缩 L3 场景中"从数据到结论"的时延。

8.3 范式外溢:推理链的可迁移性

本文的"七环节推理链"并非分子领域的专利:目标定义 → 约束编码 → 生成 → 预测 → 多目标评价 → 可行性与安全 → 闭环验证,同样的骨架可以移植到合金设计、聚合物、电池电解质、蛋白质工程乃至配方科学。S1-MatAgent 团队即明确表示其框架与具体体系无关,可推广到电催化剂、电池材料与高性能聚合物。跨领域的 Harness 一旦标准化,"性能→结构"将从一个学科的方法论,变成一类通用工程范式。

8.4 与人类科学家的新分工

最后,Agent 化并不取代科学家,而是重新定义分工:人类负责提出有价值的问题、设置正确的约束与价值观、评判前沿上的取舍;Agent 负责把问题翻译成流程、把流程执行到底、把失败变成可学习的经验。 一个高效的组合不是"AI 替代人",而是"AI 把科学家从重复劳动中释放出来,去问下一个为什么"。


结语

回到标题:Agent Plan × DeepSeek Harness:分子逆向设计从性能到结构的推理链。这条链的实质,是把一个古老而艰难的命题——“给我想要的性能,还你合格的结构”——从算法层面提升到系统层面:以生成模型实现"结构从哪来",以验证器栈实现"凭什么信它",以多目标优化实现"如何取舍",以 Agent Plan 实现"整个研究怎么组织",以 DeepSeek Harness 实现"每一步做多深、如何把失败变成下一次的起点"。

四代范式的演进告诉我们,真正的瓶颈从来不是生成能力,而是搜索的组织方式与验证的闭环质量。CAi Copilot 的 84.59%、S1-MatAgent 的 2000 万到 13、MEMOS 的 80%、Coscientist 的无人值守反应优化——这些数字勾勒的不是终点,而是"自主科学"的起跑线。当推理链的每一环都可解释、可回放、可归因,当验证层把每一次失败变成数据飞轮的新燃料,分子逆向设计才真正完成了从"性能到结构"的闭环——而站在闭环之上的,将是人类与 Agent 共同探索化学空间的崭新形态。


参考资料

  1. Nature Materials, Artificial intelligence-driven approaches for materials design and discovery(2025 综述,s41563-025-02403-7)。
  2. npj Computational Materials, Deep-learning-based inverse design model for intelligent discovery of organic molecules(s41524-018-0128-1)。
  3. M. Pan 等, Generative AI-powered inverse design for tailored narrowband molecular emitters, Digital Discovery 4, 2942(2025)。
  4. 上海人工智能实验室 × 南京大学, CAi Copilot:早期小分子设计专家 Agent(CAiMD 45 项任务基准,2025 年 8 月)。
  5. A. M. Bran 等, ChemCrow:Augmenting large-language models with chemistry tools(2024)。
  6. B. M. Boiko 等, Autonomous chemical research with large language models(Coscientist, CMU × Emerald Cloud Lab)。
  7. 阿斯利康, ChatInvent:用 Agentic AI 重塑真实药物发现(Drug Discov. Today, LangGraph 多智能体重构)。
  8. 中国科学技术大学, ChemAgents:机器人 AI 化学家多智能体系统(JACS, 2025 年 3 月)。
  9. ScienceOne AI, S1-MatAgent:Planner-driven multi-agent system for material discovery(高熵合金 HER 催化剂,性能提升 27.7%)。
  10. MIT EECS, Llamole: large language model for molecular discovery(LLM gatekeeper + 图模块触发 token)。
  11. 劳伦斯伯克利 × Meta AI, Open Molecules 2025(OMol25):逾 1 亿分子模拟快照数据集(2025 年 5 月)。
  12. R. Yao 等, From LLM to Agent: 面向 MgH2 脱氢催化剂设计的 ML 框架, Journal of Magnesium and Alloys 14, 101858(2026)。
  13. Agent for Science 综述(上海 AI Lab 等):科学 Agent 基础能力、核心流程与 L1-L4 自主性阶梯。
  14. Anthropic, Model Context Protocol(MCP)开源公告(2024 年 11 月)。
  15. OpenFold3 / Boltz-2:蛋白质-配体结构预测模型(药企私有数据共训 AISB 工作,Nature 报道)。

注:文中涉及的系统数据均引自上述公开文献与发布材料;AI 预测与实验验证数据的具体口径以原始论文为准。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐