站长之家(ChinaZ.com) 8月5日 消息:字节跳动的 Seed 团队今天发布了一个原生音视频全双工大模型,叫 SeedRealtime。跟过去把语音、视觉、文字拼在一起的级联方案不同,这个模型用统一架构直接吃音频、视频和文本三种输入,可以在连续的多模态信息流里实时对话,官方概括为边看、边听、边说。
具体到能力上,模型把声音、画面和时间信息揉在一起理解。同一个词发音一样但意思不同,模型会结合画面里的场景来判断;视频里指着某个物体说这个,它也能对上号。交互时它还能自己感知环境变化,比如发现关键目标出现就主动提醒,也能调用工具,不总是被动等人提问。
对话节奏是这次重点优化的地方。模型会实时判断对方的状态,在合适的时机接话、停顿或者回应,同时能分辨旁边人的闲聊和背景噪音,不会被干扰误触发。字节给出的端到端评测数据显示,相比级联模型,SeedRealtime 在对话节奏上的问题减少了一半,抢话、回应迟缓、被杂音打断这些卡壳明显少了。
目前 SeedRealtime 已经在豆包 App 全量上线,字节称这是音视频全双工技术在行业里第一次规模化落地。想体验的话,把豆包更新到最新版本,在对话框里选打电话进入视频通话界面就行。
全双工意味着模型可以一边听一边说,不需要等对方说完再响应。这个方向上一众大厂都在抢,字节这次直接把产品铺到几亿用户的 App 里,步子迈得不小,实际体验如何还得看上手效果。