要聞列表Google 找到了一種讓本地 AI 速度提升最高 3 倍的方法——無需任何新硬體
Decrypt2026-05-07 13:13:49

Google 找到了一種讓本地 AI 速度提升最高 3 倍的方法——無需任何新硬體

ORIGINALGoogle Found a Way to Make Local AI Up to 3x Faster—No New Hardware Required
AI 影響分析xAI Grok · medium 信賴度
TL;DR

方向偏多Google 提升本地 AI 運算效率,無需硬體升級。

影響標的
FETRNDRNEAR
建議操作

關注 AI 板塊龍頭項目

📄完整原文· 由 trafilatura 自動擷取Gemini 翻譯5749 字
簡述 - Google 為 Gemma 4 釋出了 Multi-Token Prediction (MTP) drafter,在推理時可帶來最高 3 倍的加速,且不會犧牲任何輸出品質。 - 這項技術稱為 speculative decoding,使用一個輕量級的「drafter」模型一次預測多個 token,再由主模型平行驗證,藉此繞過一次只能產生一個 token 的瓶頸。 - MTP drafter 已在 Hugging Face、Kaggle 和 Ollama 上以與 Gemma 4 相同的 Apache 2.0 授權釋出,並可與 vLLM、MLX 及 SGLang 等工具搭配使用。 在自己的電腦上跑 AI 模型很棒——直到它變得不棒。 它承諾的是隱私、不必付訂閱費,以及資料不會離開你的機器。但對大多數人來說,現實是每寫一句話之間都得盯著游標閃爍五秒鐘。 這個瓶頸有個名字:推理速度 (inference speed)。而它跟模型有多聰明一點關係也沒有。這是個硬體問題。標準的 AI 模型一次只產生一個文字片段——稱為 token。硬體必須為了產出每一個 token,把數十億個參數從記憶體搬到運算單元。它的設計本來就慢。在消費級硬體上,簡直是折磨。 多數人會採取的權宜之計,是改跑較小、較弱的模型——或是經過大幅壓縮、以部分品質換取速度的所謂量化模型 (quantized models)。這兩種方案都不算好。你得到了能跑的東西,但那並不是你真正想要的模型。 如今 Google 提出了不同的想法。該公司剛為旗下的開源模型家族 Gemma 4 釋出了 Multi-Token Prediction (MTP) drafter——這項技術能帶來最高 3 倍的加速,卻完全不影響模型的品質與推理能力。 這個做法稱為 speculative decoding,作為一個概念已經存在多年。Google 研究人員早在 2022 年就發表了奠基性的論文。它之所以直到現在才走入主流,是因為需要適合的架構才能規模化運作。 以下是它運作方式的簡短版本。與其讓那個龐大、強勁的模型獨力完成所有工作,你讓它搭配一個微小的「drafter」模型。drafter 快速又便宜——它一次預測多個 token,所花的時間比主模型生出單一 token 還短。然後大模型在一次傳遞中一併檢查所有這些猜測。如果猜測正確,你就用一次前向傳遞 (forward pass) 的代價拿到整段序列。 根據 Google 的說法:「如果目標模型同意 draft,它就會在單一次前向傳遞中接受整段序列——並在過程中額外產生一個自己的 token。」 沒有任何犧牲:那個大模型——例如 Gemma 4 的 31B dense 版本——仍然會驗證每一個 token,輸出品質完全一致。你只是在利用過去那些慢動作階段中閒置未用的運算力。 Google 表示,drafter 模型會共用目標模型的 KV cache——一種儲存已處理上下文的記憶體結構——所以它們不會浪費時間重新計算大模型已經知道的東西。對於為手機與 Raspberry Pi 等裝置設計的小型 edge 模型,團隊甚至打造了一套高效的叢集化 (clustering) 技術,進一步縮短生成時間。 這並不是 AI 圈唯一一次嘗試將文字生成平行化。基於 diffusion 的語言模型——例如 Inception Labs 的 Mercury——嘗試了一條完全不同的路線:不是一次預測一個 token,而是從雜訊開始、反覆精煉整段輸出。在紙面上很快,但 diffusion LLM 一直難以追上傳統 transformer 模型的品質,使它們比較像是研究上的好奇心,而非實用工具。 Speculative decoding 不一樣,因為它完全沒有改動底層模型。它是一種服務端的優化,而非架構的替代品。你原本就會跑的同一個 Gemma 4,變得更快了。 實際的好處是真實的。根據 Google 自己的基準測試,一個 Gemma 4 26B 模型在 Nvidia RTX Pro 6000 桌上型 GPU 上,啟用 MTP drafter 後,每秒 token 數大約翻倍。在 Apple Silicon 上,4 到 8 個請求的批次大小可解鎖約 2.2 倍的加速。並非每個情境都達到 3 倍的上限,但這仍是「勉強堪用」與「快到真的能拿來工作」之間的有意義差距。 這裡的脈絡很重要。當中國模型 DeepSeek 在 2025 年 1 月震撼市場——單日抹去 Nvidia 6,000 億美元市值——核心啟示是:效率的提升,殺傷力可能超過純粹堆算力。跑得更聰明,勝過砸更多硬體解決問題。Google 的 MTP drafter 是朝那個方向的又一步,只是這次直指市場的消費端。 整個 AI 產業現在就是由推理、訓練與記憶體組成的三角形。任何一個面向的突破,通常都會推升或衝擊整個生態系。DeepSeek 的訓練方法 (用較低階硬體達到強大模型) 是一個例子,Google 的 TurboQuant 論文 (壓縮 AI 記憶體而不損品質) 又是另一個例子。兩者都讓市場崩跌,各家公司忙著思考下一步該怎麼做。 Google 表示,drafter 解鎖了「更佳的回應性:大幅降低近即時聊天、沉浸式語音應用以及 agentic workflow 的延遲」——這些任務都必須要有低延遲才會有實用感。 應用場景很快就清晰浮現:一個不會卡頓的本地端 coding assistant;一個在你還沒忘記自己問了什麼之前就能回應的語音介面;一個不會讓你每一步都得等三秒的 agentic workflow。這一切,都跑在你已經擁有的硬體上。 MTP drafter 現已在 Hugging Face、Kaggle 與 Ollama 上以 Apache 2.0 授權釋出。它們開箱即可與 vLLM、MLX、SGLang 以及 Hugging Face Transformers 搭配使用。
資料狀態✓ 已擷取全文閱讀原文(Decrypt)
🔍歷史類似事件· 關鍵字 + 標的比對6 則
💡 目前用關鍵字 + 標的比對(MVP)· 之後會升級為 embedding 語意搜尋
原始資訊
ID:cece3c9452
來源:Decrypt
發佈:2026-05-07 13:13:49
分類:一般 · 導出分類 neutral
標的:未指定
社群投票:+0 /0 · ⭐ 0 重要 · 💬 0 留言