AB
AiBoss
ニュース

复旦大学与腾讯混元提出 ExplorationBench,评估模型探索陌生规则的能力

复旦大学与腾讯混元团队公开 ExplorationBench,要求模型在陌生规则沙盒中通过实验、反馈和验证学习,而非只凭已有知识作答。

ExplorationBench 的研究说明提出两套刻意改变规则的环境:AlienCode 与 AlienLogic。模型只拿到可交互沙盒和不完整手册,需要自行设计探针,归纳规则并回答留出题。

团队称两套环境合计设有 55 条规则和 140 道测试题,使用程序化判定而非 LLM 裁判。这是针对单次会话内探索能力的基准,并不直接衡量跨会话长期学习。

参考:ExplorationBench原始资料