AB
AiBoss
ニュース

AllSpark 发布 Iris-mini 与 Iris-pro 开源搜索智能体

据 the-decoder 报道,中国实验室 AllSpark 发布 Iris-mini 与 Iris-pro 两款开源搜索智能体及完整训练配方。团队称二者在各自参数规模的开源权重搜索智能体中表现最强,训练数据与模型还在未训练任务上出现性能提升。

核心事实

据 the-decoder 报道,中国实验室 AllSpark 发布了 Iris-miniIris-pro 两款开源搜索智能体,并公开了完整的训练配方。据该论文描述,Iris-mini 为 350 亿参数,Iris-pro 为 3970 亿参数,分别基于 Qwen 系列模型(Qwen3.6-35B-A3B 与 Qwen3.5-397B-A17B),支持 256,000 token 的上下文窗口。团队称,二者在各自参数规模的开源权重搜索智能体中取得了最强结果。模型权重已在 Hugging Face 上以合集形式提供,代码托管于 GitHub。

背景与影响

搜索智能体需要自行理解问题、决定检索内容、解读结果并判断证据是否充分。论文称,其训练流程从网页链接结构反向构造任务:以种子页面及其外链生成术语与关系图,再据此生成需要多步串联才能回答的问题,并将除最终答案外的术语改写,使线索无法通过简单文本检索解决。只有参考模型在无工具时无法解决、在有正确来源时能解决的问题才进入数据集。团队还提出「SFT-RL climbing」流程,让监督微调与强化学习交替进行。论文称,训练数据与专用模型在通用工具使用、办公任务等未训练任务上也出现性能提升,并认为搜索可能更像一项基础能力而非狭窄专长。此外,团队强调运行时上下文管理在常见基准上往往比系统间差距影响更大,并指出仅开启上下文管理的结果难以区分模型与外围框架的贡献。

限制与来源

上述参数规模、基准得分与性能结论均来自 AllSpark 团队的论文自述,尚未获独立第三方验证。论文提到,在 BrowseComp-ZH 的一个案例中,智能体给出「Bolton」被判错,而标准答案「Lannister」与素材存在矛盾,团队称此类问题促使其改进基准。目前发布内容包含 Iris Harness(智能体循环、工具、上下文管理策略及四个基准的评测),可对接任何兼容 OpenAI 的端点;数据构建与训练流水线据称将在后续发布。具体功能、可用范围与许可条款请以官方仓库及官网当前信息为准。