Google 發表實驗性開放模型 DiffusionGemma,採用影像生成領域的擴散(Diffusion)技術來生成文字,而非傳統語言模型的逐 token 自回歸方式。

DiffusionGemma 從 256 個隨機占位 token 組成的區塊出發,透過多次迭代精煉,逐步將雜訊轉化為可讀文字。這個概念源自圖像 AI,以擴散方式將雜訊轉化為清晰圖像,現在套用到文字生成。在單一 GPU 單一使用者模式下,速度最高可比傳統語言模型快 4 倍,硬體最佳化由 NVIDIA 負責。目前 DiffusionGemma 定位為實驗性模型,Google 已將其開放供研究社群使用與測試。

重點

  • 採用擴散架構生成文字,非傳統自回歸 token 輸出
  • 單一 GPU 單使用者模式下速度最高可達傳統模型 4 倍
  • 硬體最佳化由 NVIDIA 負責
  • 定位實驗性開放模型,開放研究社群使用

編輯按

擴散模型征服圖像生成後向文字生成跨界並非新話題,但 Google 以開放模型形式釋出 DiffusionGemma,讓研究社群可實際評估這條技術路線的潛力。若速度優勢能在多使用者推論場景中維持,對推論成本的影響將相當顯著,值得持續追蹤。

本文由 AI 整理,原文:TechNews 科技新報