OpenAI 宣布在 ChatGPT 中推出全新视觉广告格式与衡量工具
OpenAI 在 ChatGPT 中推出了全新的视觉广告格式,同时为广告主拓展了效果衡量工具、归因合作伙伴关系以及品牌适用性功能。
推荐理由:OpenAI 针对 ChatGPT 推出了全新的视觉广告格式,并扩展了广告衡量工具、归因合作与品牌适用性功能。
OpenAI 在 ChatGPT 中推出了全新的视觉广告格式,同时为广告主拓展了效果衡量工具、归因合作伙伴关系以及品牌适用性功能。
推荐理由:OpenAI 针对 ChatGPT 推出了全新的视觉广告格式,并扩展了广告衡量工具、归因合作与品牌适用性功能。
微软与 Hugging Face 联合发布 AI Agent 评估框架 ThinkingBox 并上线 OpenEnv。该框架不依赖生成文本或工具调用日志,而是通过校验 507 个业务工作流最终的后端数据库状态与侧效应来评估任务完成度;测试针对各模型重复运行 20 次以衡量可靠性,结果显示约 79.9% 的失败来自工具使用而非逻辑推理。
推荐理由:该框架通过校验终端数据库状态与侧效应来评估 Agent 任务完成度,为测量 Agent 连续执行的可靠性与一致性成本提供了具体方法。
summary_zh: GPT-6 系列模型指南帮助初创企业了解如何选择模型、调节推理努力程度并改进提示词与技能。此外,该指南还涵盖了如何协调工具以及为生产环境准备工作流程等内容。 GPT-6 系列模型指南帮助初创企业了解如何选择模型、调节推理努力程度并改进提示词与技能。此外,该指南还涵盖了如何协调工具以及为生产环境准备工作流程等内容。
ServiceNow CoreAI 提出 AutoSynthData 框架,旨在将目标模型的失败记录转化为企业智能体的训练数据。该框架分析目标模型的缺陷与强教师模型的成功经验并生成能力规范卡,以此自动构建包含系统规范、用户提示词及验证器的可执行任务。生成任务经验证后用于后训练,随着模型提升自动将课程重心转向后续瓶颈。
Google DeepMind 推出 SynthID Bio 技术,可将不可见水印嵌入 AI 生成的蛋白质氨基酸序列与 3D 结构中,在湿实验测试中保持了蛋白质的生物学功能。该技术已应用于 ProteinMPNN、AlphaFold 3 以及 Evo 2 模型,旨在协助 DNA 合成机构自动化审查生物风险并维护数据库真实性,相关方法与代码已向研究社区开源。
Hugging Face 宣布推出 Open TTS Leaderboard,旨在为开源及多语种文本转语音(TTS)与声音克隆模型提供可扩展的客观评估基准。榜单使用 Qwen3 ASR 计算字词错率(WER/CER)来评估语音清晰度,通过 WavLM 计算说话人相似度,并在 NVIDIA H200 GPU 与 CPU 上量化 RTFx 推理速度及首块音频时间(TTFA)。
推荐理由:Hugging Face 推出开源 TTS 榜单,通过 WER、推理速度及声音相似度等客观指标弥补人工竞技场评估扩展性不足的问题。
Google DeepMind 正式推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的原生实时对话模型引入低延迟流式视频与数字人形象。
推荐理由:Google DeepMind 为 Gemini 3.8 Live 引入了实时数字人功能,支持实时音视频生成、97 种语言同传以及后台异步工具调用,方便企业构建具备视觉形象的交互智能体。
Google 团队发布 Private AI Compute 架构更新,为其 AI 平台引入基于服务端的安全持久记忆功能。该架构通过硬件级安全区与端到端加密,将解密密钥仅保存在用户设备上,使云端 AI 能够跨设备保留上下文且包括 Google 在内的第三方均无法调阅,同时官方已发布白皮书并完成了第三方安全审计。
Mistral 宣布与 Mozilla 达成合作,其大模型现已接入 Firefox 的 AI 浏览助手 Smart Window(beta),帮助用户解析复杂搜索并基于网页标签页提炼信息。该功能首先面向法国和北美用户开放,英国和德国预计将在今年晚些时候跟进。此外,双方承诺注重隐私保护,对话默认不保存在 Mozilla 服务器,Mistral 也遵循零数据留存协议。
推荐理由:Mistral 模型已接入 Firefox 浏览助手,首先面向法国和北美用户开放且承诺零数据留存。