跳到正文
10月5日周一
  1. The Decoder67

    Aleph Alpha 发布开源大模型 Kolibri,主打德英双语与高性价比

    Aleph Alpha 正式开源德英双语大语言模型 Kolibri,采用混合专家架构,总参数量达 780 亿,每个 Token 激活约 30 亿参数。该模型支持 100 万 Token 上下文窗口,训练数据中德语占比 21.3%,在德语基准测试中取得 71% 的成绩且解码速度更快;模型权重已在 Hugging Face 上以 Apache 2.0 协议开源。

10月4日周日
10月2日周五
  1. Hugging Face Blog63

    Ai2 开源科学报告生成模型 AstaBrief 8B 并上线 Asta 平台

    艾伦人工智能研究所开源了基于 Qwen3-8B 微调的科学报告生成模型 AstaBrief 8B,并在科研 AI 平台 Asta 中作为 Fast 模式上线。该模型基于 9 万条真实科研查询构建数据集,结合 SFT 与 DPO 训练并简化全篇生成管道,生成速度比 Claude 驱动的 Thinking 模式提升约 3.5 倍。模型权重、训练数据与本地部署工作流已全量开源,方便机构在自有设施上运行。

    推荐理由:Ai2 开源了基于 Qwen3-8B 的科学报告生成模型,通过 SFT 与 DPO 优化实现单次全篇生成,在大幅提升生成速度的同时保持了引用准确度。

10月1日周四
  1. Google DeepMind83

    Google 发布前沿 AI 模型 Gemini 4 Argon

    Google DeepMind 宣布推出新一代前沿 AI 模型 Gemini 4 Argon,主打复杂多步骤工作流,并将单次输出 Token 上限大幅提升至 100 万。

    推荐理由:Google 发布前沿大模型 Gemini 4 Argon,将单次生成上限提升至 100 万 Token,主要面向长流程复杂任务、软件工程及网络安全防护。

9月29日周二
  1. Hugging Face Blog76

    NVIDIA 推出开源表格基础模型 Kumo Tabular

    NVIDIA 推出开源表格基础模型 Kumo Tabular,无需微调或特征工程即可通过单次前向传播完成表格数据的分类与回归预测。该模型完全通过合成数据预训练,提供 28M 至 215M 三种参数规模,并在 TabArena 等四个基准榜单中取得综合排名第一。

    推荐理由:该模型无需微调与特征工程,通过上下文学习在单次前向传播中完成表格预测,为结构化数据处理提供了新范式。

9月23日周三