跳到正文
Hugging Face Blog·· 2 天前精选AI 评分82

Microsoft ThinkingBox 用数据库终态检验 AI 智能体是否真正完成任务

The Agent Said It Was Done. The Database Disagreed.

AI 导读

Microsoft ThinkingBox 根据智能体执行后留下的数据库终态和副作用评分,并让507个有状态业务工作流各重复运行20次,以衡量结果一致性。在覆盖12个LLM、121,680次有效试验的消融中,79,853次未通过可执行检查,其中67.24%仍正常结束、调用了状态变更工具且未报告最终工具错误。

推荐理由

它把智能体评估从回答与工具调用转向数据库终态,并以连续20次运行揭示单次成功率难以代表工作流可靠性。

来源:Hugging Face Blog · huggingface.co