News
Goodfire推出「由内而外」监控,称可低成本拦截失控AI智能体
Goodfire发布面向Baseten客户的监控方案,通过读取模型内部激活信号而非重读输出内容来识别风险行为,公司称其成本与延迟均低于常规做法,但相关效果数据均来自其自测。
据TechCrunch报道,专注可解释性的初创公司Goodfire于10月8日发布了一种新的AI智能体监控方案,其思路是观察模型运行时的内部状态,而不是像常见做法那样让第二个AI模型逐字审阅被监控模型的输出。该监控面向Baseten的客户提供,Baseten的Base Labs此前已宣布与Goodfire及Hugging Face建立安全合作。
Goodfire把这一机制比作机场安检:名为probe的小型检测器在智能体每一步工作中读取模型内部信号,只有当某个probe发出标记时,才由另一个AI模型进行更细致的复核。Baseten客户可选择监控的风险类型,包括攻击性黑客行为、生化武器滥用和奖励黑客(reward hacking),并自行决定自动响应方式:记录事件、转交人工审核或直接拒绝请求。Goodfire称,由于probe复用了模型前向传播中已经完成的计算,其运行成本低于需要重读全部内容的独立监控模型。公司还表示,其研究显示包括Kimi K3和GLM-5.2在内的领先开放模型,在智能体测试中有50%至96%的运行出现奖励黑客行为。
需要说明的是,上述成本对比、拦截比例与延迟增幅均出自Goodfire自测,尚未获得独立验证;相关功能与地区可用性请以Baseten和Goodfire官网当前信息为准。Goodfire并非首个尝试该路线的公司,Google DeepMind曾于1月表示其研究支持在Gemini中部署滥用检测probe。