05/08/2026 13:51
【AI】字節跳動發布SeedRealtime音視頻全雙工大模型,已上線豆包
《經濟通通訊社5日專訊》字節跳動今日正式發布原生音視頻全雙工大模型SeedRealtime,並宣布該模型已在豆包App全量上線。用戶將豆包更新至最新版本後,可通過「打電話」功能進入視頻通話界面,體驗實時音視頻AI交互。
SeedRealtime採用統一端到端架構,原生融合音頻、視頻和文本,支持模型在連續多模態信息流中同步完成感知、理解、決策與表達,實現「邊看、邊聽、邊說」的實時交互。與傳統依賴ASR、視覺模型、TTS等多個模塊串聯的級聯系統相比,該模型減少了多模塊帶來的延遲和信息損耗,也不再依賴外部VAD進行輪次判斷。
字節表示,SeedRealtime實現了三項核心能力,包括音視頻聯合理解、主動交互能力以及更自然的對話節奏。模型能夠結合畫面、聲音和時序信息理解用戶意圖,例如利用視覺信息消除同音詞歧義、識別手勢和指代對象,並持續跟蹤畫面變化,在目標出現時主動提醒用戶。(jq)
SeedRealtime採用統一端到端架構,原生融合音頻、視頻和文本,支持模型在連續多模態信息流中同步完成感知、理解、決策與表達,實現「邊看、邊聽、邊說」的實時交互。與傳統依賴ASR、視覺模型、TTS等多個模塊串聯的級聯系統相比,該模型減少了多模塊帶來的延遲和信息損耗,也不再依賴外部VAD進行輪次判斷。
字節表示,SeedRealtime實現了三項核心能力,包括音視頻聯合理解、主動交互能力以及更自然的對話節奏。模型能夠結合畫面、聲音和時序信息理解用戶意圖,例如利用視覺信息消除同音詞歧義、識別手勢和指代對象,並持續跟蹤畫面變化,在目標出現時主動提醒用戶。(jq)














