跳到正文
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话,即日起在 Gemini Enterprise 提供。

    推荐理由:官方给出 Live Avatar 的实时音视频对话、异步工具调用与 97 种语言切换能力,可据此判断企业级数字人交互的落地形态。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高并发、低成本的配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:两款语音对话模型同时发布,给出基准成绩与开发者接入路径,可据此判断语音智能体的可用性。

已经到底了