智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #大语言模型 #语音生成 #因果推理 #实时AI #AI推理

Kento Nishi团队提出因果分析方法,有效抑制语音大模型中的虚假启动问题

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 12 次阅读

中文阅读 (Chinese) English Version

摘要:Kento Nishi团队针对语音到语音大语言模型(如Moshi和PersonaPlex)在用户长时间沉默时出现的虚假启动问题,提出了一种基于因果推理的抑制方法。该方法通过分析模型输出分布的变化,识别并抑制不必要的语音生成,同时保留真实响应。实验结果表明,该方法在40个测试案例中成功抑制了所有虚假启动,同时保留了所有真实响应,且无需重新训练,能够实时运行,决策时间低于61毫秒。


研究背景与问题

语音到语音大语言模型(如Moshi和PersonaPlex)在全双工生成过程中,能够同时倾听和说话。然而,在用户长时间沉默的情况下,这些模型可能会在不恰当的时候开始说话,即出现虚假启动问题。例如,在数字零输入下,Moshi和PersonaPlex在40个五分钟的连续测试中分别有12次和11次不必要地启动语音。

研究方法

研究团队提出了两种假设来解释虚假启动的原因:

  1. 重复采样选择:即使起始概率持续较低,重复采样仍会选择语音。
  2. 模型非语音输出条件化:模型对非语音输出的条件化导致起始概率突然飙升。

通过分析,研究团队发现每次观察到的起始点,语音概率在80毫秒的帧内飙升超过九个数量级,支持了第二种假设。

为了在不阻断真实响应的情况下抑制这些起始点,研究团队提出了一个因果反事实问题:模型是在响应用户语音,还是如果前面的用户输入被静音,其下一个token的分布会保持相似?据此,研究团队抑制了那些在干预下分布变化不大的起始点。

实验结果

在每个模型40个保留测试案例中,使用真实麦克风噪声的情况下,该方法成功抑制了Moshi的13/13和PersonaPlex的9/9的虚假起始点,同时保留了每个模型的40/40的真实响应。该推理时方法无需重新训练,能够实时运行,95百分位的决策时间低于61毫秒,在80毫秒的帧预算内。

技术亮点

  • 因果推理方法:通过分析模型输出分布的变化来识别和抑制虚假启动。
  • 无需重新训练:该方法在推理时应用,无需对模型进行重新训练。
  • 实时性能:决策时间低于61毫秒,能够满足实时应用的需求。
  • 高准确性:在所有测试案例中均成功抑制了虚假启动,同时保留了真实响应。

行业影响与开发者建议

该研究为解决语音大模型中的虚假启动问题提供了新的思路和方法,具有重要的应用价值。对于开发者而言,可以考虑以下建议:

  • 集成因果推理模块:在语音大模型中集成因果推理模块,以实时抑制虚假启动。
  • 优化实时性能:进一步优化算法和硬件配置,以提升实时处理能力。
  • 扩展应用场景:将该方法应用于其他类型的语言模型,解决类似的问题。

结论

Kento Nishi团队提出的因果分析方法为抑制语音大模型中的虚假启动问题提供了一种有效且高效的解决方案,具有广泛的应用前景。


消息来源:ArXiv NLP/LLM (cs.CL) (2026-09-15)

—— 完 ——

主题标签: #大语言模型 #语音生成 #因果推理 #实时AI #AI推理

社区整体评论区

正在加载实时智能评论与划词标注…