跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

3 条精选近 30 天 3 条共收录 6 条

更新

语音与音频的精选

9月25日周五第 1–3 条
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。

    推荐理由:官方给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 种语言切换等具体细节,可据此判断企业级多模态交互的落地形态。

9月23日周三
9月16日周三