8月6日快科技消息,豆包旗下视频通话功能完成重要升级,正式引入原生音视频全双工技术方案SeedRealtime。
根据官方介绍,SeedRealtime原生支持对声音和画面的联合处理,能够综合音频、视频以及时间信息,实时判断当前应由谁发言、何时需要回应或保持静默。
这意味着用户可获得“边看、边听、边说”的自然连贯交流体验,这也是音视频全双工技术首次在业内实现规模化应用。
该方案上线后,豆包视频通话可在持续变化的真实环境中维持更加自然的连续对话。
具体而言,SeedRealtime带来了三项关键能力提升。
第一是音视频联合理解:技术可以深度融合语音、画面和时序线索,不仅能结合场景消解同音词产生的歧义,还能准确理解画面中涉及时间先后的指代关系,让视觉、听觉和对话内容紧密相连。
第二是主动交互能力:系统具备持续感知环境并主动发起交流的能力,当画面状态变化或关键目标出现时,可自动向用户发出提醒,并可调用相关工具辅助表达,将交互从被动响应转变为主动协作。
第三是更为流畅的对话节奏:技术能够实时判断用户的交谈状态,在恰当的时机自然地接话、停顿或给出反馈。
同时,SeedRealtime还表现出较强的抗干扰能力,可以区分用户本人讲话、旁人闲聊以及背景噪声,减少误唤醒或误触发的情形,从而使沟通过程更加顺畅连贯。