快科技8月6日消息,今日,豆包宣布视频通话功能迎来升级,正式接入原生音视频全双工大模型SeedRealtime。
据介绍,SeedRealtime原生支持音视频联合理解,能够综合声音、画面及时间信息,判断当前该听谁说话、何时回应或保持沉默。
实现边看、边听、边说的自然连续交互,在业界率先实现音视频全双工技术的规模化落地。
该模型上线后,豆包视频通话可在连续变化的真实场景中,实现更自然的连续交互。
具体来看,SeedRealtime实现了三项核心突破。
首先是音视频联合理解,模型能够深度融合声音、画面与时序信息,既可结合当前场景消解同音词带来的歧义,也能准确理解画面中的时序指代,让所见、所闻和所说相互关联。
其次是主动交互能力,模型具备持续环境感知和主动表达能力,当画面状态发生变化或关键目标出现时,可主动向用户提醒,并能调用相关工具辅助表达,使交互从被动响应升级为主动协作。
最后是更流畅的交互节奏,模型可实时判断用户的对话状态,在适当时机自然接话、停顿或回应。
同时,SeedRealtime还具备较强的抗干扰能力,能够区分用户对话、旁人闲聊和背景噪声,减少误触发情况,使沟通过程更加流畅连贯。