原文:Previewing the Model Hardware Standard 发布:2026-08-27 · 分类:Announcements
我们正在向首批科研实验室和先进制造商开放「模型硬件标准」(Model Hardware Standard,MHS)的研究预览版——这是一份让 AI 智能体安全操控物理设备的共享规格。MHS 让 AI 智能体可以并行操控多台实验室和制造仪器,比如显微镜、液体处理器和机械臂,执行从常规药物发现实验到量子计算机激光校准等各类精细任务。MHS 的开发始于 Anthropic 与 HHMI Janelia 研究园区(HHMI Janelia Research Campus)的合作。
一个实验室或制造设施要完成硬件的部署与集成,通常需要数周甚至数月。大多数设备彼此无法通信,只能依靠专业人员构建定制集成。MHS 把这类集成工作压缩到几小时甚至几分钟。而通过把 AI 融入这些工具,MHS 还帮助研究人员和工程师更轻松地编排全天候自主运行的实验和工作流——智能体能够推演实验的每一个步骤、实时更新参数,某些情况下甚至能在无人干预的情况下从硬件错误中恢复。
我们正与科学、机器人、电子和制造领域的合作伙伴分享 MHS 的早期版本,以便在标准开源之前,携手构建安全评估,并为 AI 系统操控物理设备建立最佳实践。MHS 兼容任何带有可编程接口的设备。它也与模型无关,任何智能体框架都可以通过标准协议(如 Model Context Protocol,MCP)访问它。如需申请研究预览版的访问权限,请前往此处。
MHS 的工作原理
让实验室或工厂车间里的多台设备互相通信本身就很有挑战,更不用说再把 AI 集成进来。每台设备往往有各自的编程接口,迄今为止一直没有标准化的集成方式。而且即使设备连接起来,它们也没有统一的方式与 AI 智能体共享数据,更没有统一的方式让智能体安全地操控它们。
MHS 通过引入标准化的驱动程序来应对这些挑战——驱动程序是在计算机操作系统与硬件设备之间进行转换的软件。MHS 驱动使用一套简单的原语——比如「读」(例如「读取温度」)、「写」(例如「设置温度」)这类命令——任何硬件设备都能理解并执行。它还让每台设备以标准格式可被发现,这样设备和智能体就能在网络上互相找到并通信,无需在中间额外定制一个「翻译」程序。
MHS 驱动还能帮助 AI 智能体理解如何使用一台它从未见过的设备,向它提供仅凭代码可能无法判断的机器特性信息(例如机械臂的重量——这对于知道如何安全地操控它非常重要)。迄今为止,这类信息大多保存在纸质手册里、散落在用户的电脑上,或者作为隐性经验存在。而 MHS 驱动内置了标签,让用户可以用自然语言直接写入这些信息(用户可以自己写,也可以通过与一个采访其硬件配置的智能体对话来完成)。借助这些标签里的信息,MHS 驱动随后会自动生成一份参考文件,描述设备的一般特性:它能测量什么、可以调节什么、将强制执行哪些安全限制。这份文件给出了智能体操控设备所需的一切信息。
在设备连接好、智能体也了解每台设备的用法之后,智能体还需要一种控制硬件的方式。对 MHS 而言,这样的机制有三种:MCP、命令行界面和代码文件(API)。三者协同,即可通过一行代码编排多台设备。
一旦智能体能够控制这些设备,它就能接收每台设备的运行数据,并在高层监督和指挥工作。智能体可以跨仪器安排步骤顺序、监控结果,并随条件实时变化调整参数。当智能体需要执行长时间运行的任务,或者以高于在线推理所允许的速度操控设备时,它可以把一台或多台设备的驱动命令串接进代码文件。这样设备就能自行执行操作,无需智能体在每一步都进行推理。
在测试 MHS 的过程中,我们发现 Claude 与实验和硬件的互动方式带有探索性,很像一位科学家。例如,我们观察到 Claude 调整激光器,然后通过摄像头观察结果,评估自己的调整如何移动了激光束,并不断重复这一过程,试图理解事件序列。随后 Claude 把学到的东西打包成代码文件,写出一个确定性脚本,让激光对准不再需要每一步都推理,整个过程可以作为一条命令运行。
MHS 的早期案例
人们能用前沿模型和 MHS 做什么,我们才刚刚开始看到。但我们希望这项标准能帮助研究人员、工程师和其他从业者,在一切使用可编程接口设备的领域,加快发现与实验的进程。
在开发 MHS 的过程中,我们与生物技术、机器人、量子计算等领域的多家实验室和硬件制造商进行了分享。在这些早期项目中,我们看到 MHS 缩短了设备集成时间,让各种实验场景下的迭代更快成为可能,并协助机器的现场运行和实时故障检测。下面,我们的合作伙伴将详细介绍他们涉及 MHS 的一些早期项目。
Genentech:将 MHS 用于实验室自动化
Genentech 的研究人员实现并测试了 MHS,作为自动化 BCA 蛋白质定量检测的概念验证。这是一项测量样品中总蛋白浓度的标准流程,需要液体处理器、机械臂和酶标仪三者协同。
半个世纪以来,Genentech 一直在攻克科学和医学领域一些最棘手的难题。1977 年,我们的科学家利用重组 DNA 技术,在大肠杆菌中成功生产了生长抑素——一种调节人体胰岛素与胰高血糖素、生长激素和消化道功能的肽类激素——证明了细菌可以被改造成生产药物的生物工厂。此后不久,我们合成了重组人胰岛素,它于 1982 年成为首个获 FDA 批准的基因工程药物。从那时起,我们对基础研究和患者护理的坚持,推动我们为癌症、多发性硬化等复杂疾病发现突破性疗法。
这项工作需要在我们的药物发现实验室中进行严格的实验,通常要依赖能够运行高通量检测、并行测试大量变量的大规模自动化系统。这些系统由高度专业化的实验室机器人组成——液体处理器、机械臂、微孔板读数仪等等——需要仔细校准、反复测试,并配上复杂的编程逻辑,才能精确地执行实验。目前,搭建这些自动化系统是一个耗时的手动过程,可能需要数周甚至数月,限制了研究人员能够验证的科学想法的数量。
为了解决实验设计与自动化执行之间的这一核心瓶颈,我们与 Anthropic 合作将 MHS 用于实验室自动化。这个开放框架旨在标准化 AI 与硬件之间的通信,让科学家可以用自然语言与专业实验室机器人交互,无需编写自定义的机器人代码。我们的最终目标是建立自主实验室:由 AI 大规模承担实验执行中繁琐的机械性部分,让科学家专注于加速药物发现中那些依赖人类判断的创造性工作,比如实验设计、结果解读、决策,以及新实验方法的发明。
以 BCA 检测自动化作为概念验证
我们首先在一台围绕液体处理器搭建的大型机器人工作站上实现了 MHS。我们想看看 MHS 能否加快双辛丁酸(BCA)蛋白质定量检测的自动化——这是一项测量样品中总蛋白浓度的标准流程。该流程涉及三台仪器:一台用于精确液体转移的液体处理器、一台搬运实验器皿的机械臂,以及一台测量光吸收度(即样品在给定波长下吸收多少光)的酶标仪。我们在三台设备上都部署了 MHS,用 Claude 编排实验流程,并让它充当硬件的中央通信枢纽。所有实验都在标准 96 孔微孔板中进行——这是自动化实验设备的标配。
BCA 检测需要处理物理性质各异的液体,从简单的水性试剂到黏稠、易起泡的蛋白样品。在我们的实验装置中,我们使用已知浓度的牛血清白蛋白(BSA)作为蛋白样品,充当可靠的标准品。由于这些流体在压力和流动下的表现各不相同,移液必须极其精确,以确保转移的溶液体积准确无误。例如,BSA 溶液黏度高,在高流速(液体流过移液枪头的速度)下会形成气泡,直接影响溶液移入孔板的准确度。几乎所有自动化科学实验都始于针对每个流程优化这类流体动力学。
作为起点,我们先把标准 BCA 检测流程交给 Claude,以建立评估改进的基线。在第一轮测试中,Claude 执行了流程步骤,但它为水性和黏性溶液选择了同样的流速等通用液体处理参数,导致黏性溶液中产生气泡,造成移液不准。随后我们让 Claude 自主地为纯水和黏性蛋白样品(BSA)优化流体动力学。我们给模型提出了一个优化液体转移流速的实验设计,要求它在专家定义的流速范围内探索:用染色液体进行试移液,并用酶标仪读取吸收度,以确定每种液体的最佳流速。Claude 还能查看同一块板中由专家完成的「基准真值」转移,我们要求它尽量缩小专家结果与自己结果之间的差距。完成转移后,Claude 计算了均方根误差(RMSE)来量化自己的准确度(越低越好,零为满分;如果目标移液量是 100 微升而实际打出 98 微升,这 2 微升的偏差就会成为扣分项)。
Claude 独立执行了这些试运行,并分析酶标仪数据,以逼近专家完成的转移效果。对于水,Claude 得出约 140 µL/s 的流速最优(RMSE 为 0.016);对于 BSA,它得出的答案是 10 µL/s(RMSE 为 0.181)——我们的自动化专家确认,这些参数对我们的装置而言是合理的。通常情况下,这类优化需要自动化专家为每一组参数编写自定义编程逻辑,反复分析数据,直到找到合适的参数。
自主错误恢复与当前 AI 模型的局限
实验期间,Claude 遇到了若干意外错误,包括吸头拾取失败和液面检测错误,但都成功自行恢复——这是当前科学仪器大多不具备的能力。不过,这些实验也暴露了当前 AI 模型的局限。尽管它们擅长通用推理,但在应对物理、化学和生物约束时仍然吃力,尤其是在排查那些需要现实物理直觉的错误时。
这类局限的一个例子是液体处理过程中的气泡形成。气泡看似无害,实则会引发一连串麻烦:如果流程要求吸取 40 µL 试剂而液体中存在气泡,实际转移的液体体积会因空气占据空间而偏低。此外,当移液枪头碰到的是泡沫而非液体时,液位传感器可能触发硬件错误;气泡还会扭曲作为实验最终读数的光学测量值。
当遇到混合时气泡引起的运行错误,Claude 的默认直觉只是换不同参数在同一个孔里重试。但这只会进一步搅动液体、产生更多气泡。由于 Claude 当时并不理解失败的底层物理原因,我们不得不引导它采用对液体更温和的参数。
一旦 Claude 得知该错误码源于液体中的物理气泡、需要移到干净的孔并减少混合循环次数才能纠正,它在之后整轮运行中都保持了这一认知。随后我们把这些经验教训固化成 Claude 可复用的液体处理技能,使它能为不同物理性质的液体选择合理的默认参数,减少了液体处理错误。这些实验凸显了那类可以通过完善 Claude 的实验室自动化软件框架来弥补的推理局限。
迈向自主发现
尽管在改进 Claude 对物理实验操作的推理方面还有很多工作要做,这项研究被证明是一个极具前景的概念验证。通过用我们自己的领域专业知识评估 Claude 的决策,我们正在积累持续提升模型自动化实验性能所需的数据集。
展望未来,我们计划评估 Claude 与 MHS,在我们的药物发现实验室中编排更广泛的端到端自主工作流。我们的目标是构建一台自主发现引擎:科学家设定高层生物学意图,AI 智能体协助他们协调物理流水线——生成硬件指令、自主执行实验、运行闭环分析,并交付可直接用于筛选的模型和筛选数据。
为了扩大范围和影响力,我们需要在更多硬件上部署 MHS,比如离心机、自动化培养箱、分析仪器和传感器。我们还需要调整智能体框架,使其理解从分子到活的敏感细胞这一药物发现全流程中的细微差别。我们还得集成其他定制模型,基于实时数据全天候监控并自适应地优化实验。当 AI 承担起维护、质量控制和环境监测等常规任务后,我们的科学家就能更专注于高层的实验设计、推理和发明——这让我们朝着加速救命药物的发现又近了一步。
我们感谢为这项工作做出贡献的 Genentech 科学家,包括 Anupriya Tripathi、Matthew Bucci、Justin Nicola 和 Corinne Gullekson。
华盛顿大学 Baker 与 Pinglay 实验室:把 AI 智能体带到实验台前
华盛顿大学 Baker 与 Pinglay 实验室的博士生 Zihao Song 使用 MHS 完成了三件事:搭建一个远程监控仪器的仪表盘;实现一个由 AI 智能体监督的 qPCR(通过反复加热冷却循环复制目标 DNA 序列),让它盯着扩增曲线、在恰当的时刻终止反应;以及一套机械臂与液体处理器的集成,实现无碰撞的孔板交接。
从头(de novo)蛋白质设计——从零开始构建自然界从未出现过的蛋白质——在过去几年里,在医药、环保等领域找到了越来越多的应用。然而有两样东西拖了后腿:成本和通量。如今,设计一个像 PETase(分解塑料的酶)这样的蛋白质,成本可以低至 0.01 美元。但在实验台上测试这个蛋白质既慢又贵:每个候选约花费 100 美元、需要一周的人力——考虑到我们一次要测试 1,000 个候选,这笔账相当可观。
作为华盛顿大学 Baker 与 Pinglay 实验室的博士生,我正在开发高通量方法,以降低单次实验的成本,并大幅提升我们一次能筛选的从头蛋白质设计的数量。但在那样的规模上工作也有其自身的代价。我跑的每一轮——无论是多重设计检测,还是针对酶活性的主动学习项目——都面临同样的两个挑战:状态监控和产能。目前,我们的监控仪器分散在实验室各个角落,除非亲自走到每台仪器前查看,否则我很难了解运行进展。当运行中途出了岔子——比如 HPLC 报错停机,或液体处理器误操作毁掉一块板——我很少能在第一时间发现。等到察觉,可能已经过去好几个小时,实验样品也无法使用了。而且大多数仪器我只有一台,单台机器决定了整轮测试的节奏,我要花好几个小时守着它手动上下料。PCR 步骤是产能瓶颈中最糟的一环:它一次只能处理一块板,我必须每 90 分钟换一次板(这也是为什么我有时会在凌晨 4 点搬板子而不是睡觉)。
最显而易见的解决办法是自动化。但研究实验室靠灵活性运转,而灵活性恰恰是传统自动化无法容纳的东西。一条典型的工厂产线可能把一个流程跑 1 万次,而我的实验室一年要跑几十个流程,其中一半是新的,还得在蛋白产量远低于预期或 DNA 组装失败时于运行中途修改。加上我的仪器来自不同厂商,各有各的软件、数据格式和驱动。把它们连起来是一个集成难题,需要数月到数年,成本从数千美元到数百万美元不等,让大多数实验室望而却步。既没有标准化工作流来实现流程自动化,大多数学术实验室也负担不起把仪器连起来的费用。
为了探索一条同时绕开这两道障碍的低成本、低投入路径,我把 MHS 与一个 AI 智能体结合,在自己的实验室里跑了几个演示。MHS 本质上给了智能体眼睛、双手和时间感:它能看见每台仪器的状态、运行每一台仪器,并协调它们协同工作。
案例一:实验室远程化
在 MHS 之前,我不得不在实验室里来回巡视以监控仪器。有了 MHS,仪器把状态上报到同一个仪表盘,我和同事们用一台笔记本就能查看整个实验室,甚至足不出户、用手机询问一个 AI 智能体(图 2)。
这种远程监控对需要持续关注的实验尤其有用。定量 PCR(qPCR)就是很好的例子。qPCR 通过反复的加热-冷却循环来扩增(即复制)目标 DNA 序列,并使用一种随拷贝积累而变亮的荧光报告基团。DNA 扩增遵循 S 形曲线:每个循环让目标翻倍,所以信号还很微弱时曲线保持平坦,一旦足以检测就陡然攀升,随后在曲线顶部随着试剂耗尽、拷贝不再翻倍而再度趋平(平台期)。让反应进入平台期会使 DNA 文库失真,我就无法从中获得关于扩增 DNA 序列最终数量的准确数据。为避免这一点,我需要盯住曲线,在恰当的时刻终止反应。这可能耗时数小时,而且需要我主动盯着仪器屏幕。
MHS 免去了这份枯燥:它随数据到来持续监控并分析扩增曲线,实时汇报。它识别曲线形态,并在恰好的节点询问研究人员是停止还是继续。被告知停止时,它会终止反应,并让仪器进入下一步:4 °C 保持,以防止 DNA 降解、保证其可用于后续工作(图 3)。有 AI 智能体和 MHS 盯着曲线,我们就可以专心在实验台前准备下游测序反应,或在办公室里分析其他实验的文库富集数据。
案例二:通过孔板交接协调仪器
另一些实验不需要实时监控,却需要我反复把样品装进机器再取出来(比如高通量 DNA 扩增、蛋白质纯化,以及 ELISA 这类基于孔板的检测)。装载一次样品只需几秒,但每轮运行要一两个小时,于是我每小时都得回实验室换板。
为了把自己从整天拴在实验台前的日子里解放出来,我们使用一台基于 LeRobot 构建、装载了 MHS 的开源机械臂,来安全地协调多台仪器间的样品装载。作为演示,我重现了高通量实验运行中的一个常规交接:液体处理器向孔板中分注反应试剂;机械臂把完成的板从工作台上取走,换上一块新板,液体处理器再向新板分注。Claude Code 通过 MHS 控制并协调这两台仪器,只有上一步完成后才运行下一步,因此两台仪器在交接过程中绝不会相撞。
演示达到了预期效果。液体处理器完成分注后,AI 智能体接收到完成信号,约 10 秒后触发电机臂的下一个动作——把板从工作台上提起。在反复测试中,两台仪器从未碰撞:机械臂绝不在分注完成前移动,液体处理器也绝不在机械臂撤出板之前启动。与此同时,我在办公室的电脑上看着整个过程,什么都没碰。在 MHS 内置的安全标准之内,把这类协调交给 AI 智能体,指向了这样一个未来:智能体在夜间串起许多这样的步骤,实验台无人值守地运行。
展望
MHS 的安装比我想象的更快、更容易,尤其是考虑到我之前几次自动化尝试的结局——花数周评估平台、追着厂商要支持、学习并编写仪器之间的胶水代码,最后放弃。通过 MHS 连接六台仪器花了不到一周,包括我为它们编写驱动的时间。连好之后,AI 智能体与仪器的协作几乎不需要我操心:它发现每台设备、读取状态、调用操作,无需我手把手教它用接口。对一个多年来一直在伺候互不相通的仪器的人来说,这对我日常工作方式的改变超出预期。过去用来盯着 qPCR 曲线的时间,现在用来规划实验、读论文、分析数据,有时干脆打个盹、晒一小时太阳。
这些演示仍然只是概念验证。更复杂的实验流程要可靠运行,还需要大量优化,以及集成更广泛、更复杂的物理操作。在漫长的监控窗口中持续运行智能体也有算力成本,需要与节省下来的研究人员时间相权衡。
尽管有这些考量,我们仍兴致勃勃地继续实验 MHS 如何帮我们跑完一轮完全自主的「设计-构建-测试-学习」循环。当前每一轮从头蛋白质设计或优化都卡在交接环节——由我把结果从一个阶段搬运到下一个阶段;未来,有了 MHS 给智能体提供通往每台仪器的稳定接口,这个循环可以自己运转。我可以设想一个智能体提出一批设计、运行构建与检测、通过同一接口读回结果,并用所学规划下一轮。一个能这样一轮又一轮自主产生科学数据的实验室,即使在学术预算下,也开始显得触手可及。
我们感谢同行评议人 Pushya Krishna,以及 Xander Balwit、Rebecca Hiscott、Ethan Dyer、Conor Kelly 和 Siddharth Mishra-Sharma 提供的有益反馈。感谢 Alek Kemeny 和 Bailey Bova 帮我们搭建 MHS。特别感谢 Sudarshan Pinglay 博士在这篇博客撰写中的贡献、支持和指导,并感谢 David Baker 博士对我研究工作的指导。
卡内基梅隆大学:用快速自动化测定剂量-反应曲线
卡内基梅隆大学的研究人员使用 MHS,将系列稀释剂量-反应实验的运行速度提升了约三倍——一个 AI 智能体编排液体处理器、酶标仪、机械臂和监控摄像头,而这些设备分散在三台接口根本不兼容的计算机上。
Sina Barazandeh, Arth Banka, Gün Kaynar, Jiayi Li, Peneeta Wojcik, Carl Kingsford, Jose Lugo-Martinez, Joshua Kangas
药物开发的一个关键环节是确定剂量。一旦找到候选药物,我们需要弄清多少药量才能起效——太多可能代价高昂甚至有毒,太少则无效。合适的剂量通常通过一个称为系列稀释的过程来确定。我们从一份高浓度溶液开始,每次按相同比例稀释,并用上一次的稀释液来配制下一次。例如,将 1 份溶液与 9 份溶剂混合,得到 10 倍稀释的样品;取该样品 1 份,再以同样方式稀释,如此往复。每一步都让浓度降低固定的幅度,为我们提供一个均匀、可预测的测试范围。
这个过程耗时且容易出错,通常需要多轮迭代才能确定合适的最高浓度和稀释步长。最高浓度太高有饱和风险——信号到达上限、曲线顶部变平,高剂量区段不再提供任何有用的反应信息。步长太小则覆盖不了足够宽的范围;步长太大又会整个跳过过渡区,错过反应真正发生变化的那个点。
靠人工完成时,搭建并执行一组系列稀释实验可能需要数周。这在传统药物开发中已经够繁重,在 AI 主导的药物开发高通量筛选中就更不现实——后者旨在一次测定众多候选物的剂量。因此,系列稀释实验成为实验室机器人自动化的首要目标,也就不足为奇了。
遗憾的是,搭建这类自动化实验本身就复杂而耗时。它需要协调多台实验设备、经过多轮实验,才能得到一条可用的剂量-反应曲线。即使拥有一个自动化实验室(这绝非易事,需要多台兼容自动化的仪器和昂贵的集成软件),也可能需要数周的自动化工程和流程开发,才能建立起执行这些实验的程序。
我们的方案
MHS 让 AI 以程序化方式控制多台实验设备,使我们运行这些实验的速度提升了约三倍。我们的系统组合了:一台 CyBio Felix 液体处理器(一种在孔位、试管和孔板之间精确转移液体体积的机器人)、一台 Varioskan LUX 酶标仪(测量微孔板每个孔中荧光等光学信号的仪器)、一台搬运 96 孔板的机械臂,以及监控摄像头,由一个 AI 控制的编排器自动、动态地测量剂量-反应曲线。
单独来看,这些组件每一个都难以程序化控制,各自需要独特的接口和特定的操作模式。工程师通常必须为每台仪器学习并手写一套独立的集成,它们才能协同工作。而使用 MHS,我们得以从零开始为每台仪器开发驱动,并构建了一个编排层,让一个 Claude Opus 4.8 智能体自主运行完整流程。这总共花了大约八小时,而厂商定制的方案通常需要数周。
硬件、部署与工作流
我们的部署使用三台计算机。计算机 1 控制机械臂,通过一款调度软件控制——它接收投放到提交目录里的作业文件,而非普通 API。计算机 2 通过较老的 Windows ActiveX/COM 脚本接口运行液体处理器,并通过 USB 连接监控摄像头。计算机 3 运行酶标仪——它压根没有程序化接口,只有屏幕上的 GUI。MHS 把这三者各自转化为一份状态清单(系统可能处于的条件,例如:孔板位于 3 号位、样品温度 25 °C、孔已充液)和操作清单(它能执行的操作,如吸液或振荡),因此无论底层运行的是三种计算机控制方式中的哪一种,模型面对的都是单一、一致的接口。
工作流本身与 MHS 之前完全相同,只是现在由智能体驱动:液体处理器制备稀释系列;摄像头检查确认孔板在位且方向正确后,才允许任何转移;机械臂把孔板送到酶标仪;酶标仪测量;模型查看所得曲线,决定是调整浓度范围重跑一遍,还是接受结果。为了测试,我们用一种显色染料(颜色深浅随浓度变化的染料)替代真正的候选药物。这让实验安全、易于可视化,同时仍需要真实剂量-反应运行所需的全部决策。
每台仪器的接口各有各的难题。机械臂的调度器基于一个目录监视器,每提交一个 XML 文件会生成两个不同的文件,MHS 必须把它们调和成一个干净的结果,通常在提交后一秒内完成。液体处理器只暴露 COM 脚本、没有现代 SDK,因此每个可用的方法要么从厂商文档中摸索出来,要么由一个 Claude Opus 4.8 智能体探索接口、写出能用的驱动。单个分注周期约需四五分钟,而分注体积的允许误差只有 5%,超出就会导致曲线不可用。我们使用的酶标仪软件版本没有任何 API,所以 MHS 像人一样直接操作它的 GUI,除了屏幕上可见的内容之外,没有任何东西可以核对它的工作。
在此之前,每一步都需要有人守着:盯着机械臂的日志查故障、确认孔板是否放置到位,以及判断一条曲线是否有足够的信息量值得保留,还是浓度范围需要调整、整个实验需要重跑。现在,MHS 和智能体直接、自动地处理这三个决策。
我们用 MHS 取得的成果
为了验证 MHS 能像人类操作员一样安全运行并自我纠正,我们人为制造了六种异常状况:孔板缺失、孔板旋转、酶标仪忙、摄像头断开、设备不可达、急停被按下。系统在任一设备动作之前,就正确拦截了全部六种状况。随后我们让智能体运行系列稀释实验,以获得一条可接受的曲线。模型评估了所得曲线,但发现拟合差到无法接受(R² < 0.9,由高浓度区饱和导致),于是独立决定废弃该板,换一块新板并以压缩的浓度范围重跑(最高浓度从 200 µg/mL 降到 100 µg/mL)。第二次运行得到了强而可用的拟合(R² > 0.98,重复测量间变异为 3.4),全程无任何人工介入。
MHS 最令人印象深刻的是集成速度。从原始、未自动化的设备就绪,到完成一条稀释曲线(包含一次自主重跑),总耗时八小时。相比之下,请厂商交付一套可用的自动化装置通常需要数周。仪器照常运行各自的原生软件;MHS 只是在其上加了一层编排,无需额外的自动化软件。任何带有 API、SDK 或 GUI 界面的设备都可以集成。为每台仪器开发的驱动已经标准化,并将公开发布,其他人可以直接复用,而不必从零重复集成工作。
下一步
我们实验室未来的工作将聚焦于用真实候选药物验证该系统,并用能捕捉真实生物学效应的读数替换染料的颜色信号。我们还计划把 MHS 支持扩展到 qPCR 和显微镜等仪器,并把基于 MCP 的智能体与 MHS 设备集群集成。我们也希望缩短每台仪器的集成时间,以便把系统扩展到更大的工作流。
我们也在确保这类自动化能安全执行。我们计划增加更多安全检查,在整个实验过程中监控仪器和设备的响应状态,并完善关于高风险决策何时以及如何需要人工审批的规程。我们期待继续探索还能怎样进一步加快实验自动化——MHS 正帮助我们的研究人员更快、更安全地推进。
HHMI Janelia:用 MHS 加速显微研究
在 HHMI Janelia 研究园区,研究人员正在用 MHS 加速一系列与显微镜相关的项目。Ahrens 实验室的科学家 Virginie Ruetten 研究睡眠如何帮助身体从压力中恢复,在这里,她分享了如何用 MHS 统一并编排一套此前涉及七个不同厂商程序、没有共享接口的实验装置。
几个晚上的睡眠中断就足以造成广泛的机能损伤:认知改变、代谢失调、免疫系统变弱。如果持续足够久,睡眠丧失甚至可能致命。但我们仍然不完全理解其中的原因。睡眠之所以如此难以研究,部分原因在于它并不局限于任何一个器官。由于睡眠是一种全身性状态,要建立对它的机制性理解,就需要同时测量身体的许多部位。
显微镜提供了一条路径。经过工程改造、表达荧光传感器的细胞会发出标志其活动的光;显微镜能以高时间和空间分辨率对这些信号成像,让我们观察这些细胞在做什么。然而,大多数动物太大或太不透明,无法进行全身成像。因此,我的工作使用幼体斑马鱼。这种模式生物以体型小、身体透明著称,其器官和睡眠生理的许多方面都与包括人类在内的哺乳动物相似。
这些特性,加上我开发的一种称为 WHOLISTIC 成像的实验方法,使我们能用双光子显微镜捕捉活体斑马鱼全脑和全身的细胞活动。我们不再拍摄孤立组织的快照,而是观察细胞和器官如何在整条鱼体内即时响应和互动,从而更好地理解生理过程背后的细胞角色与底层机制。
通过统一接口控制与协调设备
开展我的实验所需的仪器摆满一整个房间。与许多先进显微镜装置常见的情况一样,我的设备由许多部件拼装而成——每个部件都单独采购、来自不同厂商、手工接线:大功率飞秒激光器;快速振镜,负责让显微镜的激光束扫过样品;超灵敏光电倍增管探测器,负责收集返回的光;以及两个精密位移台,一个负责相对样品架定位鱼,另一个负责相对显微镜定位样品架。
这些设备必须在一张紧凑的共享时间表上运行:激光必须与扫描它的振镜同步选通,位移台必须在动物移动或样品漂出焦面时进行补偿。然而,这些设备并非为协同工作而设计。每台都自带厂商控制软件,没有公共接口。它们往往还运行在不同的编程语言里:探测器跑 MATLAB,相机跑 Python,电生理跑 C#。一个程序持有的量(比如位移台的位置)对其他程序来说是未知的。但设备之间又需要通信——例如,每个位移台都需要知道另一个的位置,系统才能知道样品的绝对位置。
这种不兼容的后果是,我花大量时间琢磨怎么让设备互相通话,编写定制代码在两个程序之间搭桥——某些情况下,甚至得再加一台设备:数据采集卡(DAQ),一张在物理上路由和转换电信号的板卡,好让设备得以通信。一切接线完毕后,我仍需按固定顺序启动七个程序才能开始实验,这个过程很容易出错——启动顺序弄错,就可能葬送整个实验场次。
MHS 用单一接口取代了那些点对点连接。每台设备现在只需描述和接入一次,它的变量、控制和传感器数值都记录在存于共享内存的单一字典里——共享内存是操作系统允许许多程序共同访问的一块内存区域。
好处是硬件集成的成本不再随设备数量增长。在 MHS 之前,把新硬件集成进系统是一个以天计的项目。而部署 MHS 之后,我新增一台用于给激光束成像的相机只花了几分钟,还能把相机输出(光束位置)无缝回传给控制光束方向的振镜,实现更精确的对准。启动实验现在只需在 MHS 仪表盘上点一下,而不是七个独立步骤。
定量监控与在线分析
即使硬件接线完毕,实验前后我仍需跑一大堆检查和参数调整,以确保采集到高质量数据。这包括监控鱼的健康状况、确保相机对焦于心脏以测量心率变异性,以及检视荧光图像的质量、确保我要记录的细胞以高分辨率可见。每项检查都要从装置产出的众多数据流之一计算出一个导出量,比如荧光数据的信噪比或鱼的心率。
这类定量监控过去非常费力,因为每条数据流由单独的程序采集,录制运行时每个程序内存中的数值无法被其他程序方便地读取。在 MHS 之前,我有三个选择,没有一个理想。第一,先把数据采集下来事后分析,等保存到磁盘后在两轮运行之间迭代参数。但这要花数小时,有时最后才发现录制不可用。第二,在厂商查看器里凭肉眼判断数据。这很快,但只能得到一个印象,而不是可以在多次运行之间比较的精确测量。第三,把分析代码外挂到执行录制的程序上。但这很痛苦,因为每个产生数据流的程序都得重写一遍代码。展示数据流同样耗时,因为每个应用都需要自己定制的查看器,而且要用录制程序所用的语言编写。
MHS 统一了这个碎片化的流程,消除了逐程序重写。有了 MHS,每条数据流都以有文档记载、任何接入进程都可读的格式,存储在 MHS 共享内存的状态字典里。由于每条数据流都以同样的方式呈现,分析或可视化代码如今可以跨设备复用,并可用任何语言编写。
这让我得以编写一个模块化的在线分析框架,引导数据经过一串处理步骤:数据从一个槽位(MHS 状态字典中的一个条目)进入,经过可复用的变换(对数据的操作),结果写回另一个槽位或磁盘。可视化方面,我写了一组查看器——每种数据类型一个,而不是每台设备一个——分别用于图像、时间序列、频谱等。现在,任何数据流都可以在采集的同时被检视,检视一条新的数据流也无需重写任何代码。当我开始关心斑马鱼心率在睡眠-觉醒周期中如何变化时,我可以添加一个变换,计算由相机记录的心脏活动的频谱成分来估计心率;随后还能复用这段代码,去计算由另一台设备、用另一种语言采集的同步神经活动的频谱。投入现在汇聚在一个代码库里,而不是分散成每个设备一份。
用智能体运行更聪明的实验
实验总要做权衡。以成像为例,我必须在速度和覆盖之间取舍:扫描单个平面——穿过大脑的一个薄光学切片——可以很快;扫描很多平面、覆盖更多脑区,则很慢。找到具有我关心的振荡活动的细胞需要覆盖,测量这种活动则需要速度。
如今,大多数实验是「弹道式」的:我在开始时选定一组设置、一个条件,然后启动运行。也就是说,我必须在数据告诉我需要哪个点之前,先在权衡曲线上选好一个点。实验持续数小时,全程守在装置旁并不现实——而生物学又太多变、太混乱,无法用一个简单的确定性算法替我完成搜索。理想情况下,我不该在两者间二选一:我应该能先大范围搜索,找到具有我关心的振荡活动的细胞群,再足够快地对那个精确区域采样,以分辨细胞之间的相位关系。
智能体显微(agentic microscopy)显然是通向那里的路径:让智能体识别感兴趣区域并放大观察。但历史上,这说起来容易做起来难。难点不在于让智能体迭代编写分析代码来判断往哪里放大,而在于让它可靠地控制一套命令会移动真实设备的装置——而失败意味着撞坏的物镜,或智能体因六七个厂商程序的怪癖而浪费掉样品制备仅能维持的那几个小时。
这正是我发现 MHS 尤其有用的地方。整套装置的状态都在一个共享的标准化字典里,智能体可以通过单一接口读写每个变量,而不是七个厂商 API,这消除了各自特有的失败模式。我写了一个简单的框架,让 AI 智能体可以操作我的装置。核心的确定性循环在采集与分析之间迭代,每个结果喂给下一个决策。智能体在决策点介入,选择采集参数(例如对哪个区域成像)以及运行什么分析——在线的或离线的——以服务于用户设定的目标。而且由于 MHS 强制执行设备级安全限制,我不必担心智能体意外使用过高的激光功率之类的问题——那有漂白荧光分子、损伤样品的风险。我仍在开发这个框架并监督实验,但它已经让我找到了固定设置本会漏掉的振荡细胞群,因此要获得同样数量的可用记录,我需要的重复运行和动物都更少了。
展望未来,我想理解脑中的这些振荡如何参与睡眠与觉醒,以便我和同事们能找到提供恢复性睡眠(而不只是镇静)的药物靶点。这需要映射哪些细胞与该振荡耦合,然后运行与之锁相的扰动实验,以揭示这些细胞塑造全局脑状态的机制。做这件事需要在数据流入的同时对数千个细胞的活动拟合模型,并在录制进行的同时触发特定神经元的光激活——一种称为光遗传学的技术。
这类闭环实验很难,因为需要在由多家厂商硬件拼装、没有低延迟共享接口的装置上高速协调这么多设备。MHS 提供了速度和适应性,同时对人类和智能体都易于理解。它并不能消除细胞活动成像固有的权衡——比如速度与覆盖、信号亮度与持续时间——那些由物理决定。但它确实改变了我探索参数空间、锁定正确参数组合、并在实验条件与假设之间迭代的速度。有了 MHS,我如今期待着硬件控制不再限制我能提出的问题的那一天。
Virginie Ruetten 的项目只是 Janelia 引入 MHS 的若干项目之一。另一个由 Spruston 实验室 Arco Bast 领导的团队,在活鼠学习导航虚拟环境时,对大脑深处的神经元及其树突成像,实时观察记忆的形成。MHS 正是源自 Arco 的想法——把整套装置的状态放进共享内存的标准化字典——他的定制显微镜是第一个运行其上的装置。他装置里的每台激光器、振镜和传感器都通过 MHS 暴露,因此 Claude 可以对准光束、调谐光学元件、并用传感器核对自己的结果,把半天的手动设置变成一步完成。另一个由 Magdalena Schneider 和 Hari Shroff 共同领导的团队,正在用 MHS 实现光片显微镜的智能体控制。这让 Claude 充当编排者,实时决定如何对发育中的秀丽隐杆线虫(C. elegans)胚胎成像,以及如何在相互竞争的成像参数之间取舍。在所有项目中,MHS 都帮助研究者压缩了集成时间,并让 AI 智能体得以控制仪器、数据可视化与分析的复杂组合,为多个领域更快的发现铺平道路。
QuEra Computing:将 MHS 用于量子激光稳频
QuEra 是一家用中性原子构建量子计算机的公司,它用 MHS 让一个 AI 智能体控制其量子机器内部激光系统的部分环节。该智能体开发出一个控制器,无需人工干预即可在 99.3% 的情况下恢复激光器的「锁定」——即激光器必须保持的、用于与原子相互作用的超高精度频率。
量子计算的希望在于利用量子力学的性质,完成连最大超级计算机也无能为力的计算。QuEra 的中性原子方案,把在单个原子中可观察到的天然量子力学作为这些计算的基础。对这些原子量子比特(保存计算机信息的量子位)的控制、运行和读出,几乎所有环节都通过激光与原子的受控相互作用完成。
要做到这一点,每台激光器必须把它的颜色(即频率,以 Hz 计)保持在惊人的精度上——大约一万亿分之一。这相当于把地球到月球的距离测到一根头发丝的宽度以内。物理学家把频率保持得如此之紧的激光称为「锁定」。日常扰动——温度、振动或气压变化——都可能把激光推离目标频率、使其「失锁」,导致量子操作开始失效。量子计算机运行漫长的纠错程序时,一台中途偏离目标频率的激光器,可能毁掉花费数小时才建立起来的计算。
这项工作的核心是一台钛宝石激光器——一种原子物理和量子技术依赖了 20 多年的可调谐主力机型。传统上,这类激光器靠手动控制,由专家为一次性实验进行调谐。在 QuEra 的量子计算机中,软件会辅助这些专家,在失锁之前检测并纠正最常见的扰动。但失败的潜在来源太动态、太多样,无法全部提前规划,因此新的或不常见的故障仍需专家介入。这需要一位经验丰富的操作员,同时盯着多台仪器,判断什么动了、要纠正什么、按什么顺序、何时可以信任结果。恢复频率通常需要 5 到 10 分钟。
在大学实验室里,这项技能由一届研究生传给下一届;凌晨 2 点失锁时,总得有人醒来、开车进实验室去做恢复。对大学实验室来说,这是不便和低效。而在一家量子计算公司的设备集群规模上,把这项技能只留在少数人手里,简直难以为继。
鉴于问题空间庞大多变、待控硬件复杂、且激光系统对量子计算机的运行如此关键,QuEra 团队把激光自动恢复选为 MHS 的一个理想的首个测试用例(图 3)。
我们用 MHS 取得的成果
让激光恢复自动化在 QuEra 并不是什么新想法。在 MHS 之前,一个由激光系统工程师、软件工程师、算法专家和测试人员组成的团队,花了几个月构建了一套定制脚本来实现它。那个恢复脚本逐步复刻了人在实验台上的操作:解除维持锁定的功能,按顺序调整激光器的调谐控制,每次调谐后检查频率,若仍偏离就重来,正确后重新锁定。但它只在约 58% 的情况下有效,且每次尝试约需 150 秒。
由于该脚本完全照搬专家的做法,它也继承了同样的短板。线性序列无法吸收中途出现的变化,因此当温度或气压的变化(例如有人打开实验室的门)破坏了已经成功的步骤时,恢复流程必须从头再来。实验台前的工程师和脚本都是如此——这也是人工恢复需要 5 到 10 分钟的部分原因。把步骤自动化让序列变快了,但快不过扰动。这解释了每次尝试 150 秒和 42% 的失败率。
QuEra 把同样的问题通过 MHS 交给了 Claude。团队首先在智能体的上下文中填入目标——编写一个独立重锁激光器的 Python 脚本——以及成功的定义——第一次尝试即重锁,并保持 30 秒。我们第一次尝试时花了一两天;现在只需几个小时。随后我们制造扰动让智能体去恢复:遮挡光束、切断仪器电源以模拟电涌、以不同幅度把频率推离目标。MHS 为 Claude 提供了访问途径,让它能像人类操作员一样读取仪器、拨动控制。
准备就绪后,智能体循环以四个角色运行,每个角色都是一个全新的 Claude 实例。一个提出让恢复更快或更可靠的假设;一个把该改动写进恢复脚本;一个在真实激光器上运行更新后的脚本并记录每一步;另一个阅读日志并决定下一步改什么(图 4)。这个循环无人值守地重复了数百次、彻夜进行,每一轮都迭代改进脚本。到早晨,恢复耗时约 6 秒、成功率 96%,而起点是 150 秒和 58%(图 5)。
这一改进来自 Claude 把线性序列重写成了决策树。收敛出的脚本不再对每种扰动都走同一条路径,而是读取每台仪器、根据仪器读数构建 if-then 条件,并基于具体的物理扰动和 Claude 在反复遭遇中学到的模式进行调整。例如,如果频率几乎没有偏移,激光器的大部分控制都不会起作用,脚本就只动其中一两个,其余不碰。人类操作员则仍得逐个过一遍,因为确认某个控制是否正确的唯一办法就是检查它。Claude 通过一遍又一遍地施加扰动,直到锁定行为的模式清晰起来,才找到了这条捷径。Claude 的优势在于它能以任何操作员都无法企及的速度做到这一点。
随后,我们在没有智能体参与的情况下,用同一组随机化的诱导扰动测试了最终脚本。在 700 次试验中,它 695 次恢复了正确锁定,成功率 99.3%。最难的扰动——频率跳到远离目标处——耗时 10 到 14 秒,而实验台前的人需要 5 到 10 分钟;较简单的扰动耗时 0.9 到 5.4 秒(图 5)。最终产物是一个确定性的、完全可审查的脚本,能够在没有 AI 智能体控制的情况下在生产环境中运行。
激光锁定显著改善之后,我们又把智能体指向了锁定质量——也就是失锁的频率。这由伺服回路里 12 个相互依赖的参数(称为 PID)决定(见图 3)。把它们调好能剥离锁定中的残余噪声,让计算机的量子门更锐利、失锁更罕见。精确测量那种噪声需要采集示波器波形并做傅里叶变换,对人类来说,在 12 个参数的每次小改动之后都这么做并不现实。通常,专家针对伺服报告的均方根(RMS)误差来调谐——这对锁定质量而言是足够好的近似。PID 参数会随温度和气压漂移,所以目标是调到足够好并能维持一段时间,等锁定开始滑落再重调。下面的视频展示了其中仅仅三个参数的作用。
团队让 Claude 盯着同一个 RMS 数字,但每做一次调整,它还会采集一条波形并计算完整频谱——一整晚做了数百次。这正是人类无法匹敌的部分。最小化 RMS 误差通常确实能在整个频段上产生最低的噪声,做了多年的专家信任它一般也是对的。但 Claude 不必信任它;它可以在每次改动后确认残余噪声的确切数量,并在搜索空间里继续翻找,直到能保证找到了现实可行的最低噪声。
激光器的参数原本由 QuEra 的一位专家设定,那套长期使用的调谐测得 15.7 mV 的残余误差。在 363 次实验、16 个无人值守的小时里,Claude 把它降到了 1.55 mV——在它所优化的 RMS 指标上,噪声降为约十分之一(图 7)。为了独立验证,该专家用他惯常的方法从零重调了同一台激光器,且不看 Claude 的结果,两组参数都送入一台相位噪声分析仪——一种用于测量绝对相位噪声(每个频率上存在多少波动)的稀有专用仪器。这项检查也充当了对每组 PID 参数的公平比较。智能体的调谐在整个频段上与专家的相当,只有一处例外:在大约 220 kHz 的谐振处,手动调谐留下的噪声约为 Claude 的一千倍——正是使用 RMS 经验法则时可能出现、而 Claude 的方法得以避免的那类误差。最后一项检查也是实践中最重要的:每种调谐能保持多久。在 19 小时的运行中,Claude 的 PID 一次都没有失锁,而专家调谐的 PID 约每小时失锁 1.6 次。与重锁控制器不同,这个调谐工作流让智能体留在回路中,随条件变化调整参数。
下一步
重锁控制器是为单一激光系统构建的。但一台量子计算机拥有许多存在类似潜在故障点的激光系统——更不用说许多功能各异但同样精密、脆弱、复杂的子系统,它们同样需要本就稀缺的专家投入同样细致的关注。
在这次试点中,MHS 和 AI 智能体并没有完全取代这类专业技能。实验期间,如果物理硬件出了问题,Claude 并不知道如何排查,因为它对装置的理解是程序性的,而非物理性的。Claude 还经常在执行它认为哪怕稍有风险的动作前,停下来等待人工确认,这意味着实验有时会整夜暂停,就为了等 Claude 等到批准。不过,一个过于谨慎的智能体总好过一个不够谨慎的。最后,团队需要向 Claude 提供大量背景信息——他们希望从实验中得到什么、Claude 应如何执行——它才能正确完成任务。
即便有这些局限,试点仍表明 AI 智能体能够切实改善这类系统的控制方式,而且随着模型能力增强、对硬件的理解更深入,其中一些局限应当会缓解。接下来,QuEra 计划在真实运行的量子处理器上部署重锁恢复系统,把调谐工作流打包成独立工具,并把本次实验的经验应用到其他子系统——朝着一支越来越能自我照料的机器集群迈进。
关于该试点实验的更多细节,请阅读 QuEra 博客。
Tetsuwan Scientific:用 MHS 运行 qPCR,为本地污染画像
Tetsuwan 的研究人员将 MHS 与其自动化生物学实验平台 ResearchOS 集成。MHS 帮助编排了一套 qPCR 工作流,为描绘加利福尼亚州圣佩德罗溪(San Pedro Creek)污染特征的公民科学项目出力。
自 20 世纪 60 年代以来,实验室就拥有能移液、封板、振荡、搬运器皿、执行生物学实验室大多数其他功能的自动化机器。然而,生物学实验的大部分至今仍是手动操作。部分原因在于,大多数生物学实验本质上是动态的:样品数、板格式、条件数量在每轮之间都会变化,科学参数也是如此——稀释系列深度、孵育时间、时间点数量等等。
把单一实验配置翻译成自动化工作流,需要一名被称为自动化工程师的专家花上数周或数月。因此,只有当某个配置被超大规模重复时,自动化才划算,比如高通量筛选——一种方法用在数十万化合物的文库上。实验的主体仍是手动的,继承了随之而来的所有潜在错误和可重复性问题。
Tetsuwan 正在构建一个可通过 API 向研究人员和智能体开放的自动化生物学实验室。如果无法同时自动化小规模和大规模配置,我们的实验室就会被局限于当今实验室自动化的有限能力。我们构建 ResearchOS 就是为了解决它。ResearchOS 是一个自动化平台,用户无需任何实验室自动化经验,几分钟内即可生成、运行和管理自动化工作流。Claude 与用户协作,把自然语言流程转化成用我们的实验语法编写的脚本,最终由一个定制编译器处理成自动化代码。
ResearchOS 把用户连接到自动化实验室,但实验室本身是一个可观的编排难题。毕竟,它是一群移液机器人、机械臂和自动化实验器皿的集合,各说各的语言、各有各的脾气。我们部署 MHS,让这些设备彼此通信、也与用户通信,从而能把 Claude 用作横跨这个设备群的编排层。为了测试 MHS,我们让平台投入加利福尼亚州 Pacifica 的一个公民科学项目:运行定量 PCR(qPCR),刻画圣佩德罗溪粪便污染的来源——几十年来,那里的污染水平一直处于危险的高位。
在 qPCR 工作流中实现 MHS
聚合酶链式反应(PCR)是许多生物学实验室最常用的流程之一,它仅凭一块称为热循环仪的金属块——加热又冷却——就能复制 DNA。DNA 是双链分子,加热使双链分离,以便复制。冷却让引物——与你想复制区域两端匹配的短 DNA 片段——粘到链上并标记复制的起点。再次升温(但不如之前那么高),则让一种称为聚合酶的酶沿着引物所在的链延伸,完成复制。qPCR 加入一种随拷贝积累而变得更亮的染料,让我们知道起初有多少拷贝。我们可以用它测量某个基因被开启的强度、检测并定量患者样本中的病原体,以及像我们这个案例这样,测量环境样本中某种特定生物的存在量。
qPCR 需要一种黏稠、类似肥皂的试剂,称为「预混液」(master mix),其中包含各反应共用的化学成分。这些液体特性使预混液在移液时特别容易产生气泡和泡沫,可能导致移液不准、降低实验质量。借助 MHS,我们接上了一台摄像头来检测这类错误并触发自动恢复流程。
有一次,摄像头识别出机械臂夹持的试管里的预混液中有气泡。仅靠机械臂自己无法消除气泡。于是 ResearchOS 在网络上扫描能帮上忙的 MHS 连接设备,Claude 通过 Slack 向我们建议了一套错误处理策略:把试管移到离心机,低速短暂离心,把液体甩到管底,消除气泡。随后,Claude 通过 MHS 向离心机下达了相应的命令。
这个编排层还让流程保持与硬件无关。例如,一个流程可能要求以 15,000 × rpm 将板甩沉五分钟,而不指明离心机的具体型号。ResearchOS 可以用 MHS 在网络中查询一台兼容的离心机,学习其驱动接口,再用 Claude 把流程中指定的力转换成那台机器接受的参数。比如对一台只接受转子转速的机器,这意味着把力除以离心机转子的半径。流程作者甚至完全不必知道用的是哪台离心机,也不必知道测量是如何换算的。
用 MHS 改进编译器启发式
我们还用 Claude 搭建了一个闭环优化实验,来改进我们的编译器——它把高层代码翻译成实验室设备可执行的指令。我们取来 qPCR 流程,把它编译成一系列贴近现实的工作单,覆盖多种实验设置,比如用不同的样品组合、样品数量和重复数(同一样本的多次运行)测试不同的引物组。由此我们确定了编译器能实现多少种不同类型的液体转移。然后我们在不同条件下于机器人上试跑这些转移,并用示踪染料测量其准确度和精密度。实验结束后,Claude 通过 MHS 从酶标仪取回准确度数据,加以分析和可视化,然后提出改进编译器转移精度模型的建议。有了更精确的预测和已知的系统性偏移(测量值中可预测的误差),编译器就能在机器布局和枪头复用上做出更明智的权衡,最终让我们的实验更快、更便宜、更准确。
在整个实验过程中,我们测试了 9,143 次单独分注、300 种独特转移类型(液体 × 枪头 × 体积 × 分注次数 × 过吸),以及四种液体下的 1,508 个测量条件。在留出实验上,Claude 与 MHS 帮助精炼的模型对多次分注精度的预测,比厂商技术规格书准了约 12%,在 45 次运行中赢了 31 次(符号检验 p ≈ 0.001)。在我们重复次数最多的数据上,这一数字提升到约 17%。
来自圣佩德罗溪的初步数据
尽管这些只是早期测试,我们 qPCR 检测的初步数据印证了圣佩德罗溪流域联盟的发现:人类是圣佩德罗溪粪便污染的主要来源。我们用 qPCR 扩增了不同宿主生物——人类、马、鸟、狗——特有的细菌 DNA 片段。
我们用通用的 16S 标记检测到大肠杆菌(E. coli)的存在,并用 AllBac 引物检测到拟杆菌的存在。16S 是所有细菌共有的核糖体 RNA 基因。通过设计引物组去探测 16S 中含有种间差异的序列,即可识别宿主物种(本例中是大肠杆菌)。
我们还用 HF183 和 BacH 引物观察到了清晰的人类相关拟杆菌的扩增。在我们的实验中,没有检测到其他宿主特异的拟杆菌。在未来的实验中,我们旨在更好地刻画污染来源,并定量评估污水中人类相关拟杆菌的浓度。
归根结底,MHS 带来的更优设备集成、编排和实时错误恢复,对于弥合硬件、科学家与模型之间的鸿沟至关重要。随着 ResearchOS 和 MHS 这类工具不断提升实验室自动化的能力,我们相信实验将变得愈发可及、可复现、可编程。
想进一步了解本项目的优化与社区科学部分,请访问我们的博客。
注 1:在实验室自动化领域称为「液体处理器」。注意,6 自由度机械臂与液体处理器不是一回事;液体处理器专为移液优化,而非通用用途。工作单元(workcell)——把多台实验室机器人组合成单一系统——通常同时使用液体处理器(用于移液)和机械臂(用于转运孔板和其他器皿)。
硬件厂商以及为它们提供支持的软件公司,也正在把 MHS 支持构建进自己的设备,让 AI 智能体更容易发现和操作这些设备。例如:
- Amazon Web Services 将通过 Strands Robots(一个用于把 AI 智能体连接到物理设备的库)支持 MHS。在 MHS 研究预览版期间,AWS 将向参与者提供 Strands Robots 软件包的私有预发布版本。
- Automata 正在为其实验室自动化平台 LINQ 增加 MHS 支持,以便在自主实验室中对仪器执行智能错误处理。
- Danaher 与 Anthropic 正在积极探索 MHS 支持的能力如何帮助其智能仪器和自主实验室扩展生物医学研发的规模。
- Doosan Robotics 正在其机械臂上测试 MHS,包括执行自动化质量保证,以及协调多台机器人之间的任务。
- MBF Bioscience 正在为 ScanImage 构建一个 MHS 驱动——ScanImage 是全球数百家神经科学实验室运行激光扫描显微镜所用的软件——以把 AI 智能体集成进实时数据分析与实验。
- QIAGEN 正在其核酸纯化平台 QIAsymphony Connect 上,通过一个可运行的概念验证来试验 MHS,展示 AI 智能体如何帮助实验室更快排查仪器故障、指导操作员完成恢复,并在降低生物样本风险的同时提高仪器的正常运行时间。
- Tecan 正在为其 Fluent 液体处理平台增加 MHS 支持,让 AI 智能体可以直接发现并操作它们。
- Universal Robots 已获得 MHS 的早期访问权限,并计划在其机器人平台中增加支持。
加入研究预览版
合作伙伴的这些早期结果令人鼓舞,但在开源之前,这项标准还有更多工作要做。作为大语言模型,Claude 通过文本和图像了解物理世界,这意味着它的空间推理和物理推理存在局限,仍需要专家监督。例如在处理蛋白样品时,Genentech 的研究人员必须引导 Claude 认识到,样品起泡导致的错误是物理故障而非软件缺陷,只能通过恰当的物理纠正来消除。
MHS 目前也还不支持缺少编程接口的硬件,因此我们正与这类设备的制造商合作,把 MHS 驱动内置进去。许多开发者已经在用 Claude Code 操作单件物理设备;在 MHS 的下一阶段,我们希望把标准扩展到开发者所构建的更多设备。早期采用者包括 Hugging Face——正在其机器人库 LeRobot 中加入 MHS 支持——以及 Raspberry Pi——在用其相机 MHS 驱动完成成功测试后,正着手在多款产品中启用 MHS 集成。
我们还将借助研究预览版,与首批合作伙伴构建更多的安全评估,加强 AI 在物理世界中使用的防护。我们正在制定一份物理安全路线图,以进一步强化我们的安全保障政策,扩大对滥用风险的执法覆盖。开源 MHS 时,我们将发布研究预览版的发现,作为安全部署该标准的指引的一部分。
我们诚邀各行业的利益相关者加入 MHS 研究预览版的候补名单。如果您希望参与,请在此提交意向。
致谢
MHS 源于 Anthropic 有益部署(Beneficial Deployments)团队的 Alek Kemeny 与 HHMI Janelia 研究园区博士后科学家 Arco Bast 的合作。Bast 当时在一套装置上运行复杂的脑成像实验,装置汇集了来自不同厂商的激光器、电动聚焦器和专用相机,没有公共接口。为了加快实验,他开发了一个共享内存字典,让仪器之间能以内存速度通信。Kemeny 与 Bast 携手把 AI 模型集成进了这个接口。
我们感谢迄今为这项工作做出贡献的每一个人,包括但不限于:Aaron Boswell、Ben Arthur、Boaz Mohar、Gagan Bhat、Mark Kittisopikul、Nadine Yasser、Nick Purcell、Takashi Kawase 和 Virginie Ruetten。我们期待与业界合作伙伴、以及不久之后与开源社区一起,把 MHS 推向前进。