字节跳动发布SeedRealtime音视频全双工大模型,可实现边看边听边说实时交互
关键词: SeedRealtime 全双工大模型 音视频多模态 豆包 字节跳动
8月5日,字节跳动正式发布原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。
SeedRealtime采用统一端到端架构,原生融合音频、视频和文本,支持模型在连续多模态信息流中同步完成感知、理解、决策与表达,实现“边看、边听、边说”的实时交互。与传统依赖ASR、视觉模型、TTS等多个模块串联的级联系统相比,该模型减少了多模块带来的延迟和信息损耗,也不再依赖外部VAD进行轮次判断。
字节表示,SeedRealtime实现了三项核心能力,包括音视频联合理解、主动交互能力以及更自然的对话节奏。模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。
在官方展示的多个应用案例中,模型能够在多人聚会中识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时持续监测翻页过程,在指定章节出现后自动提示。
在复杂环境下,SeedRealtime还能根据多模态信息判断何时回应、何时保持沉默。官方演示显示,在机场等嘈杂场景中,模型能够区分用户与旁人对话,避免因背景噪声或无关聊天误触发回应;在儿童学习场景中,也能够持续跟随用户互动,不受背景电话等声音干扰。
字节披露的端到端人工评测结果显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约50%,包括抢话、回应延迟以及背景噪声误触发等情况均明显下降,同时单次对话能够完整、流畅进行的概率也有所提升。
字节表示,未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力,推动AI从传统问答交互进一步发展到能够在真实场景中持续理解环境并协助完成实际任务。