跳到正文
  1. Hugging Face Blog74

    微软与 Hugging Face 发布 AI Agent 评估框架 ThinkingBox

    微软与 Hugging Face 联合发布 AI Agent 评估框架 ThinkingBox 并上线 OpenEnv。该框架不依赖生成文本或工具调用日志,而是通过校验 507 个业务工作流最终的后端数据库状态与侧效应来评估任务完成度;测试针对各模型重复运行 20 次以衡量可靠性,结果显示约 79.9% 的失败来自工具使用而非逻辑推理。

    推荐理由:该框架通过校验终端数据库状态与侧效应来评估 Agent 任务完成度,为测量 Agent 连续执行的可靠性与一致性成本提供了具体方法。

  1. Hugging Face Blog63

    Ai2 开源科学报告生成模型 AstaBrief 8B 并上线 Asta 平台

    艾伦人工智能研究所开源了基于 Qwen3-8B 微调的科学报告生成模型 AstaBrief 8B,并在科研 AI 平台 Asta 中作为 Fast 模式上线。该模型基于 9 万条真实科研查询构建数据集,结合 SFT 与 DPO 训练并简化全篇生成管道,生成速度比 Claude 驱动的 Thinking 模式提升约 3.5 倍。模型权重、训练数据与本地部署工作流已全量开源,方便机构在自有设施上运行。

    推荐理由:Ai2 开源了基于 Qwen3-8B 的科学报告生成模型,通过 SFT 与 DPO 优化实现单次全篇生成,在大幅提升生成速度的同时保持了引用准确度。

  1. Hugging Face Blog66

    Hugging Face 推出开源 TTS 榜单,提供多语种与声音克隆客观评估

    Hugging Face 宣布推出 Open TTS Leaderboard,旨在为开源及多语种文本转语音(TTS)与声音克隆模型提供可扩展的客观评估基准。榜单使用 Qwen3 ASR 计算字词错率(WER/CER)来评估语音清晰度,通过 WavLM 计算说话人相似度,并在 NVIDIA H200 GPU 与 CPU 上量化 RTFx 推理速度及首块音频时间(TTFA)。

    推荐理由:Hugging Face 推出开源 TTS 榜单,通过 WER、推理速度及声音相似度等客观指标弥补人工竞技场评估扩展性不足的问题。

  1. Hugging Face Blog76

    NVIDIA 推出开源表格基础模型 Kumo Tabular

    NVIDIA 推出开源表格基础模型 Kumo Tabular,无需微调或特征工程即可通过单次前向传播完成表格数据的分类与回归预测。该模型完全通过合成数据预训练,提供 28M 至 215M 三种参数规模,并在 TabArena 等四个基准榜单中取得综合排名第一。

    推荐理由:该模型无需微调与特征工程,通过上下文学习在单次前向传播中完成表格预测,为结构化数据处理提供了新范式。

  1. Mistral AI61

    Mistral 宣布与 Mozilla 合作,为 Firefox Smart Window 浏览助手提供模型支持

    Mistral 宣布与 Mozilla 达成合作,其大模型现已接入 Firefox 的 AI 浏览助手 Smart Window(beta),帮助用户解析复杂搜索并基于网页标签页提炼信息。该功能首先面向法国和北美用户开放,英国和德国预计将在今年晚些时候跟进。此外,双方承诺注重隐私保护,对话默认不保存在 Mozilla 服务器,Mistral 也遵循零数据留存协议。

    推荐理由:Mistral 模型已接入 Firefox 浏览助手,首先面向法国和北美用户开放且承诺零数据留存。

  1. Mistral AI75

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元。本轮融资由三星电子领投,Scaleup Europe Fund 与 PSG Equity 联合领投,NVIDIA、a16z、BlackRock 管理基金等参投。资金将用于扩充训练算力储备、拓展基础设施与国际业务,并推进涵盖开源权重模型与私有化部署的主权 AI 全栈研发。

    推荐理由:Mistral 完成 30 亿欧元 D 轮融资,由三星电子领投且估值超 210 亿欧元,资金将用于扩展算力与推进主权开源 AI 研发。

已经到底了