← Think BIG NEWS
產業實測手記 · 第 002 期 THINKBIGTW.COM

THINK BIG

NEWS
被 AI 看見

本機部署 AI · 實測手記

本地跑大模型,GPU 真的有在動嗎?——「裝得起來」不等於「跑得好」

本地 AI 慢到每題要等好幾分鐘,最常見的原因不是電腦不夠力,而是模型根本沒用到顯卡、全程在用 CPU 算。打一個指令 ollama ps,看「PROCESSOR」欄寫的是 100% GPU 還是 100% CPU,十秒就能確認。

(註:本文以開源工具 Ollama 為例說明,因為它是目前在個人電腦上跑本地模型最常見的方式之一;其他工具的原理相同,檢查指令不同。)


一、現象:大家在討論什麼

把 AI 模型裝在自己電腦上跑(本地部署),這一年從工程師的玩具變成一般人也會考慮的選項:資料不出門、不用按次付費、斷網也能用。隨之而來最常見的抱怨只有一句:「裝好了,但慢到不能用。」

這個抱怨在開源社群有很清楚的紀錄:

Ollama 官方 GitHub 上有使用者回報,模型會「偶爾不用 GPU、整個載入 CPU,CPU 使用率 100%,重開才恢復」。(來源:ollama/ollama #13765)

也有使用者回報,更新到某個版本後,模型不再自動使用 GPU,全部載入記憶體用 CPU 跑。(來源:ollama/ollama #13320)

多篇故障排除整理指出,這類問題最麻煩的地方是不會報錯:驅動版本太舊、某個環境變數被設成停用顯卡,模型都會安靜地改用 CPU,畫面上看起來一切正常。(來源:cmaven 多 GPU 故障排除整理、localaimaster.com)

也就是說,「本地 AI 很慢」通常不是一個效能問題,而是一個沒被發現的設定問題。

二、各方評價:本地跑 AI,值不值得?

看好的一方認為,本地部署的好處很實在:資料留在自己電腦、沒有按量計費的帳單焦慮、可以 24 小時常駐。對在意隱私、又想長時間讓 AI Agent 幫忙做事的人,這是雲端服務給不了的。

保留的一方的意見集中在兩點:

1. 門檻比想像高:驅動、環境變數、模型大小、記憶體配置,任何一環沒對上,效果就差很多,而且一般人不知道從哪裡查起。

2. 硬體要對:模型如果比顯示記憶體大,放不下的部分會被分到 CPU 去算,速度明顯掉下來。官方說明裡也寫了,模型可能出現「部分 CPU、部分 GPU」的分配狀態。(來源:Ollama 官方 FAQ)

兩邊其實說的是同一件事:本地 AI 可以很好用,但前提是有人確認它真的在用該用的硬體。

◆ 第一手手記

三、我們實際做的時候的心得

Think BIG 幫人把 AI Agent 裝在本機時,「GPU 沒在動」是我們最常遇到、也最容易被漏掉的問題。以下是不具名的通用經驗:

1. 看起來正常,才是最危險的狀態。我們遇過一台機器,模型裝好、對話也答得出來,但每問一題要等上一到四分鐘,有時直接逾時。前面花了不少時間調其他設定,最後才查到:模型全程在用 CPU 推理,顯卡一點都沒用到。從此我們把「先確認 GPU 有在動」排到所有調校的第一步。

2. 一個指標就能戳破。Ollama 有兩個地方可以看:ollama ps 的 PROCESSOR 欄(官方說明:100% GPU、100% CPU,或兩者混合),以及 API 回傳的顯示記憶體用量(size_vram)。顯示記憶體用量是 0,就是純 CPU 在跑,不管畫面看起來多正常。我們現在交付前一定截這個數字留證據。

3. 原因常常不在「硬體夠不夠」。我們實際查到的原因有三種,都不是換電腦能解決的:

顯卡沒被偵測到:部分新架構的內顯或整合型晶片,預設不會被自動抓到,需要額外的環境設定,而且要設在「實際執行模型的那個使用者帳號」底下才會生效。

安裝環境有特殊字元:我們遇過偵測程序因為安裝路徑的關係直接失敗(這個坑會在下一期單獨講)。

記憶體配置拉太滿:AI 一次能記住的內容(上下文視窗)設太大,記憶體被吃光,連帶整台系統不穩。Ollama 預設是 4096 個 token(官方 FAQ),要調大可以,但要配合機器規格抓合理值。

4. 修好之後,差的不是一點點。同一台機器、同一個模型,從純 CPU 改成真的跑在顯卡上,回應從「等好幾分鐘」變成「幾秒內開始出字」。速度差這麼多,是因為設定,不是因為硬體升級。

四、我們的建議:本地 AI 慢,先做這三步

先看 PROCESSOR 欄,再談其他。打 ollama ps,看到 100% CPU 就是沒用到顯卡;看到 CPU/GPU 混合,通常是模型比顯示記憶體大。這一步十秒,能省下你好幾個小時。

模型大小配合顯示記憶體。不是參數越大越好。放不進顯示記憶體的模型,跑起來可能比一個小一號、但全部放得進顯卡的模型還慢。

讓「確認 GPU」變成例行檢查。驅動更新、軟體更新、換使用者帳號之後,都可能讓模型默默改回 CPU。每次異動後重看一次,不要等到「怎麼又變慢了」才查。

一句話收尾:本地 AI 慢,先懷疑設定,再懷疑電腦。多數時候,你的電腦夠用,只是還沒被用上。

◆ 編按 · Think BIG 的做法:這套架構帶來什麼

交付前有證據,不是口頭說「裝好了」

(以下是 Think BIG 自己的立場,與上方中立報導區隔。)

我們幫人本機部署 AI Agent 時,「GPU 真的在動」是交付前的必查項目,不是出問題才補做:

交付前有證據,不是口頭說「裝好了」。我們會確認模型實際使用的硬體與顯示記憶體用量,並用「真的會呼叫工具」的任務實測回應速度,不只測聊天。

資料跑在你自己手上。本機部署,資料落地在你的電腦;模型可依你的硬體挑選、之後也能換。

固定版本、不自動更新。版本更新是 GPU 默默失效的常見原因之一,所以我們固定版本,有更新先驗過再上。

本地 AI 的價值,要在「真的跑在對的硬體上」之後才兌現。我們做的,就是把這一步確認完再交給你。

常見問答 · FAQ

Q:怎麼知道本地 AI 模型有沒有用到顯卡?
用 Ollama 的話,打 ollama ps 看 PROCESSOR 欄:寫 100% GPU 是全部在顯卡上,100% CPU 是完全沒用到顯卡,出現 CPU/GPU 比例代表模型只有一部分放進顯卡。
Q:明明有獨立顯卡,為什麼 AI 還是用 CPU 跑?
常見原因有驅動版本太舊、環境變數停用了顯卡、模型比顯示記憶體大,或顯卡沒被軟體偵測到。這些情況多半不會跳出錯誤訊息,所以要主動檢查。
Q:本地 AI 每題要等好幾分鐘,是電腦太差嗎?
不一定。我們實際遇過的案例,多數是模型沒用到顯卡、全程在用 CPU 算。先確認 GPU 有沒有在動,再決定要不要升級硬體。
Q:模型是不是越大越好?
不是。放不進顯示記憶體的大模型,會有一部分改用 CPU 算,速度可能比一個小一號、能完整放進顯卡的模型還慢。模型大小要配合你的顯示記憶體。
Q:上下文視窗(AI 的記憶容量)要設多大?
Ollama 預設是 4096 個 token。要調大可以,但每加大一級都會多吃記憶體;設太大可能讓整台電腦變得不穩。依機器規格逐步調整,比一次拉滿安全。
參考來源 Ollama 官方 FAQ(PROCESSOR 欄判讀、預設上下文 4096):docs.ollama.com/faq · Ollama GitHub #13765(偶爾不用 GPU、改用 CPU):github.com/ollama/ollama/issues/13765 · Ollama GitHub #13320(更新後不再自動使用 GPU):github.com/ollama/ollama/issues/13320 · 多 GPU 故障排除整理(驅動版本與靜默改用 CPU):cmaven.github.io · Ollama 不用 GPU 的常見原因整理:localaimaster.com

本文為 Think BIG 產業實測手記,根據第一手部署經驗整理,內容不代表任何特定廠商立場,亦不針對任何公司或產品。引用之官方文件與社群回報均標註來源;各工具指令與預設值以官方文件最新版本為準。

THINK BIG NEWS · AI 導入的第一手觀察 Think BIG, Make it Real! 大想成業有限公司