小米开源工业级目标说话人语音识别大型语言模型 CocktailASR-1,解决鸡尾酒会难题
把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚社区驱动的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...
把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚社区驱动的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...

