字節跳動(ByteDance)旗下的語音 AI 研究團隊 SeedRealtime 正式推出 Seeduplex,這是一款支援全雙工(Full-duplex)通訊的語音 AI 模型,讓 AI 在說話的同時能夠繼續聆聽使用者的輸入,並即時做出「繼續說、等待還是停止」的判斷。

重點

  • 全雙工語音能力:不同於傳統半雙工模式,Seeduplex 允許 AI 邊說話邊接收音訊輸入,模擬真實人類對話的交疊特性
  • 即時決策機制:模型能在極低延遲下判斷使用者是否插話,動態調整 AI 的說話行為(等待、接話或停止)
  • 官方數據公布:SeedRealtime 團隊公開了 Seeduplex 的性能指標,並說明現階段的限制與應用情境
  • 技術突破:全雙工語音是實現更自然人機語音互動的關鍵技術,此前主要應用在電信領域

編輯按

全雙工語音 AI 一直是語音助理領域的「聖杯」之一。傳統 AI 語音助理必須等使用者說完才能回應,容易讓對話感覺生硬、不自然。Seeduplex 的推出代表字節跳動在這個技術方向上取得了重要進展,若未來整合進 Doubao 等產品,將大幅改善使用者的對話體驗,也進一步縮短與人類自然語音對話的差距。

本文由 AI 整理,原文:AI郵報