project
Faraday - Inherent 推出的 AI 科学家智能体
Faraday 是伦敦 AI 实验室 Inherent 推出的 AI 科学家智能体,基于 270 亿参数的 Qwen 3.6 模型,通过强化学习训练而成。Faraday能像人类博士生一样,在不预...
Faraday是什么
Faraday 是伦敦 AI 实验室 Inherent 推出的 AI 科学家智能体,基于 270 亿参数的 Qwen 3.6 模型,通过强化学习训练而成。Faraday能像人类博士生一样,在不预先知道答案的情况下,自主阅读论文、设计实验并复现研究结果。Faraday 在论文复现基准 Replica 上表现超越 Claude Opus 4.8 和 GPT-5.5。
Faraday的主要功能
- 自主论文复现:阅读被遮盖结果图表的学术论文,推断实验方法,在 60 分钟 + 有限 GPU 资源内自主设计并执行复现实验
- 科学实验设计:面对无法全规模复现的实验,能按比例缩小但仍忠实于原论文核心主张,展现”研究品味”
- 工具调用编程:将 Codex GPT-5.5 作为外部编码工具,自己负责科学决策,代码执行交给专业编程 agent
- 跨领域泛化:训练于 ML 论文,测试于 AI-for-Science 论文,具备跨领域迁移能力
Faraday的技术原理
- 基座模型选择:Faraday 基于 Qwen 3.6-27B 构建,仅 270 亿参数,团队通过强化学习后训练赋予其科学决策能力,将代码实现交由外部工具完成,验证科学智能与工程智能可以解耦。
- Coding Agent as a Tool (CAT) 架构:Faraday 通过 shell 工具调用 Codex GPT-5.5 作为外部编程助手;Faraday 专注高层科学决策,包括理解论文、设计实验方案和分配计算资源,由 Codex 负责具体的代码编写与调试执行。
- Replica 任务空间:训练数据来自自动生成的 Replica 基准,涵盖 100 篇 1990–2026 年的知名论文共 310 个复现任务;用 Gemini 2.5 Pro 自动识别并遮盖论文中的结果图表形成任务,Agent 需在 60 分钟和 1/7 个 H200 GPU 的严格限制内自主复现本。
- Rubric-based Judge 奖励系统:针对复现任务无确定答案的难题,系统先用 Claude Opus 4.7 为每个任务自动生成专属评分标准(隐藏原始 gold plot 以防过拟合),再由 Codex GPT-5.5 作为执行 judge,在 10 分钟内审查代码库、git 历史和交互记录,从视觉匹配、科学主张支持、实验忠实度、资源利用效率和科学诚信五个维度给出 0–1 分的奖励信号。
- 长程强化学习训练:Faraday 采用修改版 GRPO 算法配合 LoRA 微调(rank=128),在 128K token 上下文窗口中以 6×10⁻⁶ 学习率进行后训练;每批次均匀采样覆盖不同时代的论文,确保训练不受单一科学范式主导,实现稳定的长程非可验证任务优化。
如何使用Faraday
Faraday 目前处于研究发布阶段,尚未推出面向公众的 API、产品界面或体验入口。
Faraday的核心优势
- 小模型大能力:基于 270 亿参数的 Qwen 3.6,在论文复现任务上超越 Claude Opus 4.8 和 GPT-5.5,证明科学智能无需依赖超大规模模型。
- 工具解耦架构:采用 Coding Agent as Tool (CAT) 范式,Faraday 专注科学决策,将代码实现交由 Codex GPT-5.5 完成,实现科学智能与工程智能的高效分工。
- 研究品味培养:通过强化学习习得”研究品味”,在资源受限时仍能设计忠实于原论文的缩小版实验,拒绝硬编码和作弊捷径。
- 跨领域泛化:在 ML 论文上训练,在 AI-for-Science 论文上测试仍保持 60% 以上任务胜率,展现强大的跨领域迁移能力。
- 可扩展基准:基于 Replica 自动生成任务空间,从 100 篇论文扩展出 310 个复现任务,为 AI 科学家训练提供可规模化的数据基础。
- 稳定长程 RL
成功将 GRPO 强化学习扩展到长程、非可验证的科研任务,通过 per-task rubric judge 和 turn-level credit assignment 实现稳定训练。
Faraday的项目地址
- 项目官网:https://inherentlabs.ai/research/training-to-replicate
- arXiv技术论文:https://arxiv.org/pdf/2608.13331
Faraday的同类竞品对比
| 对比维度 | Faraday (Inherent) | The AI Scientist (Sakana AI) |
|---|---|---|
| 核心定位 | 专注”论文复现”,验证已有研究结果的可靠性 | 端到端自主科研——从假设生成到论文撰写的全流程 |
| 基座模型 | Qwen 3.6-27B(小模型+外部工具) | 调用 Claude/GPT 等前沿模型作为基础 |
| 工作方式 | 像人类博士生一样复现论文图表,使用 Codex 作为编程工具 | 自主提出研究想法、运行实验、撰写 LaTeX 论文 |
| 任务范围 | 复现已发表论文中的特定结果图表(Replica 基准) | 从零开始生成完整研究课题并产出可投稿论文 |
| 验证方式 | 自动 Rubric-based Judge + 人类专家评估复现质量 | 通过真实学术会议(ICLR Workshop)同行评审验证 |
| 开源情况 | 论文与 Replica 基准已公开,模型未开源 | AI Scientist v1/v2 代码已在 GitHub 开源 |
Faraday的应用场景
-
学术论文复现验证:科研机构可用 Faraday 批量验证已发表论文的可复现性,解决机器学习领域的”复现危机”。
-
博士生科研训练:作为”虚拟研究助手”,帮助博士生通过复现经典论文来培养实验设计与科学品味。
-
AI-for-Science 实验验证:在材料科学、气象预测、生物信息学等领域,自动复现跨学科论文中的实验结果。
-
研究基准测试:为 AI 科学家 Agent 提供标准化的 Replica 评估框架,用于衡量不同模型在科研任务上的能力。
-
研究方法审计:期刊审稿人或基金评审机构可用 Faraday 快速检验投稿论文中实验结果的真实性与可复现性。