#本地模型
共 21 篇相關文章
-
Kimi K3 開放權重釋出:2.8 兆參數、百萬 Token,但本機部署需 64 顆 GPU 以上
月之暗面旗下 Kimi K3 完整模型權重公開釋出,採 MoE 架構、總參數 2.8 兆、原生支援 100 萬 Token 上下文,程式碼與 Agentic 能力突出,然而 1.56 TB 檔案大小與 64 顆加速器以上的部署需求,讓一般開發者難以本機執行。
-
FEV 與微軟在 NVIDIA DRIVE AGX 平台部署 Phi-4-mini 小語言模型,實現車端離線語音控制
歐洲工程商 FEV 與微軟合作,將 Phi-4-mini-instruct 小語言模型部署於 NVIDIA DRIVE AGX 車用運算平台,即使斷網環境也能透過語音指令設定儀表板,展示端側 SLM 在車載場景的實際落地能力。
-
千問 3.5 Agent 基準測試:27B 稠密模型全數通過、397B MOE 幾乎全軍覆沒的原因解析
針對千問 3.5 全系列設計 15 場景、12 工具的 Agent 基準測試,結果 27B 稠密模型(Dense)全數通過,35B 至 397B 的 MOE 模型幾乎全軍覆沒,關鍵在於 MOE 僅激活部分參數導致工具返回資料傳遞失敗。
-
AMD Gorgon Halo 地端 AI 新架構:Ryzen AI MAX 400 統一記憶體擴至 192GB 挑戰本地大模型極限
AMD 在 Advancing AI 2026 發表 Gorgon Halo(即 Ryzen AI MAX 400 系列),統一記憶體從 128GB 擴增至 192GB,主打地端本地 AI 運算,讓個人工作站可跑更大規模的 AI 模型。
-
ownscribe 開源 CLI 工具:本地優先、免雲端的 AI 會議逐字稿與摘要
開發者 nczz 釋出 ownscribe,一款本地優先的 AI 會議逐字稿與摘要 CLI 工具,語音辨識與摘要均在本機完成,資料不上傳雲端,適合重視資料隱私的開發者與企業。
-
Thinking Machines Lab 發表首款開放權重模型 Inkling,MoE 架構總參數達 9750 億
由 OpenAI 前技術長 Mira Murati 共同創辦的 Thinking Machines Lab 於 7 月 15 日發表首款開放權重模型 Inkling,採混合專家(MoE)架構、支援多模態輸入,開發者可自由下載微調。
-
GIGABYTE AI TOP + vLLM + Hermes Agent 打造 24 小時自主 AI 工作團隊地端部署攻略
AI郵報詳解如何以 GIGABYTE AI TOP 工作站搭配 vLLM 推論框架與 Hermes Agent,在本地端部署多模態開源模型,組成不需雲端 API 即可全天候自主運作的 AI Agent 工作流,同時保有資料主權。
-
PrismML 發表 Bonsai 27B:首個可在 iPhone 原生執行的 270 億參數大型語言模型
AI 新創 PrismML 推出 Bonsai 27B,宣稱是首個可在 iPhone、iPad、Mac 上原生執行的 27B 大型模型,以低位元壓縮技術縮小體積至可在行動裝置執行,以 Apache 2.0 授權開源,傳蘋果正評估採用可能。
-
蘋果接觸 AI 新創 PrismML,評估讓 270 億參數 Qwen 大模型直接在 iPhone 17 Pro 本地執行
據報導,蘋果正評估與 PrismML 合作,其模型壓縮技術可讓阿里巴巴 270 億參數 Qwen 3.6 在 iPhone 17 Pro 本地運行,突破現有手機端 AI 僅能啟用數十億參數的規模瓶頸。
-
NVIDIA RTX Spark、AMD Strix Halo、Apple M5 Max:2026 年三強 AI SoC 完整效能解析
深度比較 NVIDIA RTX Spark、AMD Strix Halo 與 Apple M5 Max 三款頂尖 SoC 的 AI 算力與整合記憶體容量,三強鼎立代表地端 AI 推論市場正式成熟,用戶不需雲端 GPU 即可執行大型模型。
-
開源工具 livecaption:macOS Apple Silicon 本地即時語音轉錄與英中翻譯,無需雲端
GitHub 開源專案 livecaption 為 macOS Apple Silicon 裝置提供即時串流語音識別、說話者分離與英中即時翻譯,完全本地執行於 Apple GPU/MLX,無 UI、純 CLI,適合重視隱私的開發者場景。
-
AMD Ryzen AI Halo 開發者平台上市,3,999 美元本地 LLM 算力直搶輝達 DGX Spark
AMD 正式上市 Ryzen AI Halo 開發者平台,售價 3,999 美元,採旗艦 Ryzen AI MAX+ 395 SoC(Strix Halo),整合 Zen 5 十六核與高效能 NPU,主攻本地端大型語言模型推理,直接對標 NVIDIA DGX Spark(4,679 美元)。
-
自架 AI 全能工作空間 Odysseus:整合聊天、Agent 與郵件管理,GitHub 破 5.4 萬星
開源專案 Odysseus 是隱私優先的自架 AI 工作空間,支援聊天、自主 Agent、深度研究、文件協作、電子郵件 AI 分類與行事曆管理,相容 Ollama/vLLM 本地 LLM,GitHub 星數已超過 5.4 萬。
-
COMPUTEX 2026:NVIDIA RTX Spark 整合 Blackwell 與 Grace,聯發科受惠切入 AI PC 供應鏈
NVIDIA 發表 RTX Spark 超級晶片,將 Blackwell RTX GPU、Grace CPU 及 CUDA 生態整合至 Windows PC,主打本地端 AI 代理,聯發科同步進入高階 AI PC 供應鏈。
-
MediaTek Dimensity 8550 發布:中階 Android 手機首獲 Gemini Nano V3 on-device AI 能力
MediaTek 正式推出 Dimensity 8550,搭載 LLM Booster 並原生支援 Google Gemini Nano V3,讓中階 Android 手機首次具備可與旗艦機比肩的本地端 AI 推論能力。
-
開源 GUI-VLA Agent Mano-P:OSWorld 排名第一,本地推論資料不離裝置
Mano-P 是開源 GUI 視覺語言動作代理,在 OSWorld 基準測試中排名第一(58.2%),可在 Apple M4 Mac mini 或 MacBook 完全本地執行,資料不傳送至雲端。
-
NVIDIA GTC Taipei 2026 企業 AI 三連發:Nemotron 3 Ultra、NemoClaw Agent Toolkit、DGX Station for Windows
NVIDIA 在 GTC Taipei 2026 發表開源推理模型 Nemotron 3 Ultra、企業 Agent 開發套件 NemoClaw,以及可在桌機本機運行兆參數模型的 DGX Station for Windows,標誌 NVIDIA 加速向全堆疊 AI 平台轉型。
-
NVIDIA 加入 Windows on Arm,RTX Spark 平台帶動 AI 筆電 2029 滲透率預估達 34%
TrendForce 報告指出,NVIDIA 推出 RTX Spark 平台搭配 N1/N1X 處理器加入 Windows on Arm 陣營,首次將 CUDA 生態延伸至 Arm 架構,預估帶動 AI 筆電市占率於 2029 年達 34.2%。
-
Google DeepMind 推 Gemma 4 12B 多模態開放模型,16GB 筆電可本機運行
Google DeepMind 發布 Gemma 4 12B,為首款支援原生文字、影像、音訊三模態的 Gemma 模型,16GB 統一記憶體即可本機運行,效能接近兩倍參數量的 Gemma 4 26B。
-
Karpathy 提出 LLM Wiki:讓 AI 主動維護知識庫,打造會自我演化的第二大腦
OpenAI 創始成員 Andrej Karpathy 提出 LLM Wiki 概念,讓 LLM 持續整理並更新知識庫,與 RAG 的靜態查詢不同,是知識系統能自我演化的新玩法,可搭配 Obsidian 等工具實作。
-
LEANN:RAG 系統省 97% 儲存空間,可完全在個人裝置本機私密執行
MLsys2026 研究成果 LEANN 讓 RAG 應用節省 97% 儲存空間、維持高準確率,且 100% 本地執行無需上雲,適合隱私敏感場景。