跳到正文
  1. Hugging Face Blog62

    Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型

    Liquid AI 发布 d1 决策模型家族的两款开源权重模型 d1-3B 和 d1-omni-600M(实验性)。

    推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可据此判断小模型做结构化决策的可行性。

  1. Google DeepMind71

    Google DeepMind 发布 EmbeddingGemma 2 开源轻量多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,这是面向端侧的多模态嵌入模型,原生将文本、图像、音频和视频映射到统一嵌入空间。

    推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于判断本地多模态检索的可行性。

  1. Mistral AI78

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,预览 API 已在 Mistral Studio 上线,权重将于本月底发布。

    推荐理由:Mistral 官方给出 1 万亿参数多模态模型的开放权重路线与自建欧洲算力背景,可据此判断开源前沿模型的竞争格局。

  2. Latent Space76

    Reflection 发布 Beam:501B-A23B 美国开源 MoE 模型

    Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。

    推荐理由:汇总了 Beam 的架构、训练规模与第三方评测口径,可对照同期开源模型的定位差异。

  1. Latent Space84

    Google DeepMind 发布 Gemini 4 Argon,支持 100 万 token 输出

    Google DeepMind 发布 Gemini 4 Argon,面向编码、企业知识工作和网络防御,首发仅限政府用户与 Fairwind 计划中的可信网络防御者,后续再向开发者、企业和消费者开放。

    推荐理由:汇总 Gemini 4 Argon 的基准、定价与第三方评测分歧,便于对照其与 Astra、Opus 5.5 的实际差距。

  2. Google DeepMind82

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方披露了 Argon 在编码、企业知识与网络安全防御上的能力与定价,可据此判断前沿模型的落地节奏。

  1. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与研究者的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。

  1. Hugging Face Blog66

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,提供 27B 稠密和 35B-A3B MoE 两种规格,均可通过 H Models API 调用,权重已在 Hugging Face 以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源。

    推荐理由:Holo4 同时支持 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机智能体的成本与能力取舍。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:两款语音对话模型同时发布,给出基准成绩与开发者接入路径,可据此判断语音智能体的可用性。

已经到底了