這次測試顛覆了「參數越大效果越好」的直覺——在 Agent 任務場景下,27B 的稠密模型(Dense)完全碾壓了最高達 397B 的 MOE 混合專家模型。

重點

  • 測試規模:15 個真實 Agent 場景、12 種工具調用的完整基準測試
  • 測試對象:千問 3.5 全系列,涵蓋 27B Dense 到 35B~397B MOE 各規格
  • 結果:27B Dense 全數通過;35B~397B MOE 幾乎全軍覆沒
  • 根本原因:MOE 架構每次推理只激活部分專家參數,在工具調用時容易丟失關鍵的工具返回資料,導致後續步驟錯誤
  • 稠密模型優勢:層數更深、注意力機制比例更高,上下文追蹤能力更強,在長鏈工具調用中具結構性優勢

編輯按

這個測試結果對本地部署 AI Agent 的開發者有直接參考價值:在本地跑 Agent 時,選擇 MOE 大模型並不能帶來更好的效果,反而應該優先考慮同等或更小的稠密模型。架構選擇比參數量更重要。

本文由 AI 整理,原文:FB分享酷