跳到正文
  1. Hugging Face Blog74

    微软与 Hugging Face 发布 AI Agent 评估框架 ThinkingBox

    微软与 Hugging Face 联合发布 AI Agent 评估框架 ThinkingBox 并上线 OpenEnv。该框架不依赖生成文本或工具调用日志,而是通过校验 507 个业务工作流最终的后端数据库状态与侧效应来评估任务完成度;测试针对各模型重复运行 20 次以衡量可靠性,结果显示约 79.9% 的失败来自工具使用而非逻辑推理。

    推荐理由:该框架通过校验终端数据库状态与侧效应来评估 Agent 任务完成度,为测量 Agent 连续执行的可靠性与一致性成本提供了具体方法。

  1. Google DeepMind83

    Google 发布前沿 AI 模型 Gemini 4 Argon

    Google DeepMind 宣布推出新一代前沿 AI 模型 Gemini 4 Argon,主打复杂多步骤工作流,并将单次输出 Token 上限大幅提升至 100 万。

    推荐理由:Google 发布前沿大模型 Gemini 4 Argon,将单次生成上限提升至 100 万 Token,主要面向长流程复杂任务、软件工程及网络安全防护。

  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 正式推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的原生实时对话模型引入低延迟流式视频与数字人形象。

    推荐理由:Google DeepMind 为 Gemini 3.8 Live 引入了实时数字人功能,支持实时音视频生成、97 种语言同传以及后台异步工具调用,方便企业构建具备视觉形象的交互智能体。

  1. Mistral AI70

    Mistral AI 分享用 AI Agent 迁移 4 万行复杂遗留代码的实践经验

    Mistral AI 团队协助欧洲某能源企业将其 4 万行 Fortran 77 模拟器代码迁移至 C++,并总结出基于数值校验与人机协同 Agent 的重构方案。

    推荐理由:本文结合欧洲能源企业的遗留系统重构实践,总结了利用 AI Agent 将 4 万行 Fortran 代码迁移至 C++ 的架构设计与人机协同方法。

已经到底了