跳到正文
9月30日周三
  1. Hugging Face Blog66

    Hugging Face 发布 Open TTS Leaderboard,覆盖开源多语言 TTS 与语音克隆评测

    Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与语音克隆模型。榜单以 Qwen3 ASR 转写计算 WER/CER 衡量可懂度,以 RTFx 和 TTFA 衡量 H200 GPU 上的批量推理与流式延迟,并以 WavLM 嵌入余弦相似度衡量说话人相似度,把单个模型评测从数周缩短到数小时。

    推荐理由:原文对比了人工偏好竞技场与客观指标评测,说明新榜单用 WER、RTFx、TTFA 和说话人相似度补齐开源 TTS 评测的缺口。

9月25日周五
  1. Google DeepMind64

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar 实时虚拟形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能说的动态虚拟形象。该功能今天起在 Gemini Enterprise 可用,支持后台异步工具调用、97 种语言间的无缝语音同步切换,以及基于参考图像定制品牌虚拟形象,所有音视频输出均带 SynthID 水印。

    推荐理由:原文列出了实时视觉形象、后台异步工具调用与 97 种语言同步能力,读者可据此评估企业级虚拟客服的落地方式。

9月23日周三
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色 voice 设计与逐句表演控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款模型分别面向创意配音与高并发场景,并给出语音复制的同意验证与 SynthID 水印机制,便于评估合规接入。