AI 產業的算力競爭重心正在從訓練移向推理(Inference),Agentic AI 應用爆發帶動的多輪對話、工具呼叫與長上下文需求,讓推理效率成為 Computex 2026 展會最核心的技術議題。

重點

  • 2025 年 12 月:NVIDIA 以 200 億美元取得 Groq 的推理技術授權與核心技術團隊
  • 2026 年 2 月:加拿大 AI 晶片新創 Taalas 發表推理晶片 HC1,在 Llama 3.1 8B 模型達到 16,960 tokens/s/user 的極高速率
  • HC1 每百萬 tokens 推理成本約為 NVIDIA B200 throughput 優化模式的數分之一
  • Agentic AI 工作流程需要大量串行推理,對低延遲、高 tokens/user 的需求遠超傳統 batch 推理場景
  • 推理晶片市場正從 NVIDIA 一家獨大,走向多方競逐局面

編輯按

NVIDIA 重金取得 Groq 技術,說明推理效率的護城河已成為下一個十億美元級戰場。Taalas HC1 等新興晶片以極高的 tokens/user 速率切入,正好瞄準 Agentic AI 的低延遲需求痛點。若 AI 代理成為主流應用,推理晶片的選型邏輯將與訓練晶片截然不同,整個 AI 基礎設施生態正在被重新定義。

本文由 AI 整理,原文:TechNews 科技新報