

Loading comments…
制作者
mocha_byte
访问网站
research.nvidia.com/labs/adlr/personaplex/
项目信息
产品关键词
NVIDIA PersonaPlex 是一款全双工对话式 AI 模型,支持自然、实时的对话,并具备可自定义的声音和角色。与传统的级联系统(ASR→LLM→TTS)不同——这类系统因尴尬的停顿而显得机械,也不同于将你锁定在单一声音中的全双工模型——PersonaPlex 结合了自然的对话动态和角色灵活性。它能同时听和说,处理打断、反馈和真实的轮流发言,同时通过文本提示维持任何选定的角色。
PersonaPlex 能同时听和说,在用户说话时更新内部状态,并立即流式返回响应。这消除了级联系统的延迟,并重现了人类式的提示,如停顿、打断以及“嗯哼”或“哦”等反馈。
从多种声音中选择,并通过文本提示定义任何角色——无论是智慧助手、客户服务代理还是奇幻角色。模型在整个对话中维持所选角色,在任务遵循方面优于现有系统。
PersonaPlex 展示了从文本提示中强大的指令遵循能力,如在客户服务示例中验证身份、记录患者详情并确保保密性。即使在同时听和说时,它也能传达同理心和自然的轮流发言。
通过语音提示,PersonaPlex 可以控制口音,为多样化用例(如区域客户服务或多语言交互)增加另一层自定义。
“首次,你既能获得所需的自定义,又能享受让对话真正人性化的自然感。”
这句话概括了 PersonaPlex 的突破:打破了角色灵活性与对话自然性之间的权衡。虽然之前的全双工模型(如 Moshi)提供了自然交互,但将你锁定在固定的声音和角色中,而 PersonaPlex 让你通过文本提示定义任何角色,同时保持实时听、说和打断处理。结果是一个不仅遵循指令,还能重现人类用于理解意图和情感的非语言提示的模型。
你正在构建需要自然交互和角色自定义的对话式 AI 应用——例如客户服务代理、虚拟助手或交互式角色。如果你曾因级联系统的机械感或现有全双工模型的僵化而苦恼,PersonaPlex 尤其相关。它对于对话动态的研究也值得探索,因为在打断处理、反馈和任务遵循方面,它优于现有系统。
其他您可能感兴趣的工具