Faraday – Inherent 推出的 AI 科学家智能体
Faraday是什么
Faraday 是伦敦 AI 实验室 Inherent 推出的 AI 科学家智能体,基于 270 亿参数的 Qwen 3.6 模型,通过强化学习训练而成。Faraday能像人类博士生一样,在不预先知道答案的情况下,自主阅读论文、设计实验并复现研究结果。Faraday 在论文复现基准 Replica 上表现超越 Claude Opus 4.8 和 GPT-5.5。

Faraday的主要功能
- 自主论文复现:阅读被遮盖结果图表的学术论文,推断实验方法,在 60 分钟 + 有限 GPU 资源内自主设计并执行复现实验
- 科学实验设计:面对无法全规模复现的实验,能按比例缩小但仍忠实于原论文核心主张,展现”研究品味”
- 工具调用编程:将 Codex GPT-5.5 作为外部编码工具,自己负责科学决策,代码执行交给专业编程 agent
- 跨领域泛化:训练于 ML 论文,测试于 AI-for-Science 论文,具备跨领域迁移能力
Faraday的技术原理
- 基座模型选择:Faraday 基于 Qwen 3.6-27B 构建,仅 270 亿参数,团队通过强化学习后训练赋予其科学决策能力,将代码实现交由外部工具完成,验证科学智能与工程智能可以解耦。
- Coding Agent as a Tool (CAT) 架构:Faraday 通过 shell 工具调用 Codex GPT-5.5 作为外部编程助手;Faraday 专注高层科学决策,包括理解论文、设计实验方案和分配计算资源,由 Codex 负责具体的代码编写与调试执行。
- Replica 任务空间:训练数据来自自动生成的 Replica 基准,涵盖 100 篇 1990–2026 年的知名论文共 310 个复现任务;用 Gemini 2.5 Pro 自动识别并遮盖论文中的结果图表形成任务,Agent 需在 60 分钟和 1/7 个 H200 GPU 的严格限制内自主复现本。
- Rubric-based Judge 奖励系统:针对复现任务无确定答案的难题,系统先用 Claude Opus 4.7 为每个任务自动生成专属评分标准(隐藏原始 gold plot 以防过拟合),再由 Codex GPT-5.5 作为执行 judge,在 10 分钟内审查代码库、git 历史和交互记录,从视觉匹配、科学主张支持、实验忠实度、资源利用效率和科学诚信五个维度给出 0–1 分的奖励信号。
- 长程强化学习训练:Faraday 采用修改版 GRPO 算法配合 LoRA 微调(rank=128),在 128K token 上下文窗口中以 6×10⁻⁶ 学习率进行后训练;每批次均匀采样覆盖不同时代的论文,确保训练不受单一科学范式主导,实现稳定的长程非可验证任务优化。
如何使用Faraday
Faraday 目前处于研究发布阶段,尚未推出面向公众的 API、产品界面或体验入口。
Faraday的核心优势
- 小模型大能力:基于 270 亿参数的 Qwen 3.6,在论文复现任务上超越 Claude Opus 4.8 和 GPT-5.5,证明科学智能无需依赖超大规模模型。
- 工具解耦架构:采用 Coding Agent as Tool (CAT) 范式,Faraday 专注科学决策,将代码实现交由 Codex GPT-5.5 完成,实现科学智能与工程智能的高效分工。
- 研究品味培养:通过强化学习习得”研究品味”,在资源受限时仍能设计忠实于原论文的缩小版实验,拒绝硬编码和作弊捷径。
- 跨领域泛化:在 ML 论文上训练,在 AI-for-Science 论文上测试仍保持 60% 以上任务胜率,展现强大的跨领域迁移能力。
- 可扩展基准:基于 Replica 自动生成任务空间,从 100 篇论文扩展出 310 个复现任务,为 AI 科学家训练提供可规模化的数据基础。
- 稳定长程 RL
成功将 GRPO 强化学习扩展到长程、非可验证的科研任务,通过 per-task rubric judge 和 turn-level credit assignment 实现稳定训练。
Faraday的项目地址
- 项目官网:https://inherentlabs.ai/research/training-to-replicate
- arXiv技术论文:https://arxiv.org/pdf/2608.13331
Faraday的同类竞品对比
| 对比维度 | Faraday (Inherent) | The AI Scientist (Sakana AI) |
|---|---|---|
| 核心定位 | 专注”论文复现”,验证已有研究结果的可靠性 | 端到端自主科研——从假设生成到论文撰写的全流程 |
| 基座模型 | Qwen 3.6-27B(小模型+外部工具) | 调用 Claude/GPT 等前沿模型作为基础 |
| 工作方式 | 像人类博士生一样复现论文图表,使用 Codex 作为编程工具 | 自主提出研究想法、运行实验、撰写 LaTeX 论文 |
| 任务范围 | 复现已发表论文中的特定结果图表(Replica 基准) | 从零开始生成完整研究课题并产出可投稿论文 |
| 验证方式 | 自动 Rubric-based Judge + 人类专家评估复现质量 | 通过真实学术会议(ICLR Workshop)同行评审验证 |
| 开源情况 | 论文与 Replica 基准已公开,模型未开源 | AI Scientist v1/v2 代码已在 GitHub 开源 |
Faraday的应用场景
-
学术论文复现验证:科研机构可用 Faraday 批量验证已发表论文的可复现性,解决机器学习领域的”复现危机”。
-
博士生科研训练:作为”虚拟研究助手”,帮助博士生通过复现经典论文来培养实验设计与科学品味。
-
AI-for-Science 实验验证:在材料科学、气象预测、生物信息学等领域,自动复现跨学科论文中的实验结果。
-
研究基准测试:为 AI 科学家 Agent 提供标准化的 Replica 评估框架,用于衡量不同模型在科研任务上的能力。
-
研究方法审计:期刊审稿人或基金评审机构可用 Faraday 快速检验投稿论文中实验结果的真实性与可复现性。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号