跳到正文
Hugging Face Blog·· 2 天前精选AI 评分74

微软与 Hugging Face 发布 AI Agent 评估框架 ThinkingBox

The Agent Said It Was Done. The Database Disagreed.

AI 导读

微软与 Hugging Face 联合发布 AI Agent 评估框架 ThinkingBox 并上线 OpenEnv。该框架不依赖生成文本或工具调用日志,而是通过校验 507 个业务工作流最终的后端数据库状态与侧效应来评估任务完成度;测试针对各模型重复运行 20 次以衡量可靠性,结果显示约 79.9% 的失败来自工具使用而非逻辑推理。

推荐理由

该框架通过校验终端数据库状态与侧效应来评估 Agent 任务完成度,为测量 Agent 连续执行的可靠性与一致性成本提供了具体方法。

来源:Hugging Face Blog · huggingface.co