CPU、GPU、TPU 不只是速度差異:真正關鍵是資料怎麼流動
我以前看到 CPU、GPU、TPU 的比較時,腦中通常只會浮現一個很粗糙的理解:
CPU、GPU、TPU 不只是速度差異:真正關鍵是資料怎麼流動
我以前看到 CPU、GPU、TPU 的比較時,腦中通常只會浮現一個很粗糙的理解:
CPU 是通用處理器。 GPU 適合平行運算。 TPU 是 Google 做的 AI 晶片。
這些話都對,但也都有點空。
真正讓我比較有感的,是 Google Cloud TPU 文件裡的幾個動畫。
因為那幾個動畫讓我突然意識到,CPU、GPU、TPU 的差異,不只是「誰比較快」,而是它們處理資料的方式完全不同。
CPU:什麼都會,但不是什麼都最快
我們每天用的電腦、手機、伺服器,大多都離不開 CPU。
可以把CPU 想像成一位很強的教授。
他什麼題目都能改,也能處理很複雜的邏輯。 但如果今天有幾十萬張類似的考卷要批改,他就算再聰明,也會卡在一張一張拿、一張一張放的流程裡。
所以 CPU 的優勢不是大量重複計算,而是彈性很高。

CPU 運作方式 (Source: Google Cloud TPU Architecture documentation, licensed under CC BY 4.0 unless otherwise noted)
在 CPU 的動畫裡,可以看到一件事情:
資料從記憶體被拿出來,送到 CPU 裡計算,算完之後,再把結果放回記憶體。這個過程看起來很直覺。但問題是,如果每一次計算都要去記憶體拿資料、算完再存回去,那當任務變得非常巨大時,真正拖慢速度的可能不是「不會算」,而是「資料一直搬來搬去」,稱為Neumann bottleneck.
如果想更深入了解CPU底層架構: ISA structure — x86 vs. ARM vs. RISC-V)
GPU:不是比較聰明,而是人比較多
如果你玩遊戲、做 3D 渲染,畫面上每一個像素、每一個光影變化,其實都需要大量計算。這些計算有一個特色:
很多任務很像,而且可以同時做,像是一大群助教一起批改考卷,這就是 GPU 擅長的地方。

GPU 運作方式 (Source: Google Cloud TPU Architecture documentation, licensed under CC BY 4.0 unless otherwise noted)
GPU 的動畫看起來就不一樣了。
它不是只有少數幾個核心在工作,而是有大量 ALU,也就是算術邏輯單元,可以同時執行很多乘法和加法。這很適合 AI,因為神經網路裡面有大量矩陣運算。
矩陣運算聽起來很抽象,但你可以先把它想成:
很多數字同時相乘、相加。這種事情非常適合拆給很多人一起做。所以 GPU 像是一間很大的助教教室。每個助教不一定像教授一樣什麼都會,但人很多,可以同時改很多類似的題目。
GPU 雖然有大量平行運算能力,但它仍然是比較通用的處理器。也就是說,每個運算單元在計算時,仍然需要讀取運算元、儲存中間結果。換句話說,GPU 比 CPU 更擅長大量平行計算,但資料搬運這件事仍然存在。
TPU: AI 最常算矩陣,那硬體就直接為矩陣而生
如果 CPU 是通才,GPU 是平行運算高手,那 TPU 更像是一條專門為 AI 打造的自動化產線。
它不是什麼都能做。它也不是為了取代 CPU 或 GPU 的所有功能。
它的核心問題其實很直接:
既然神經網路最常做的是矩陣運算,那我們能不能直接做一個硬體,專門把矩陣運算做到極致?
TPU 的設計就是朝這個方向前進:直接改變工作流程。

TPU 運作方式 (Source: Google Cloud TPU Architecture documentation, licensed under CC BY 4.0 unless otherwise noted)
在動畫裡,可以看到 TPU 先從高頻寬記憶體 HBM 載入參數,再載入資料。接著,資料會進入一個由大量乘法累加器組成的陣列。
這個陣列叫做 systolic array,中文常翻成脈動陣列。
我第一次看到這裡時,真正有感的地方是:
TPU 的資料不是每算一步就一直回記憶體拿東西,而是像水流一樣,沿著一排排計算單元往下流。每個計算單元做一小段乘法和累加。資料流完整個陣列後,矩陣運算的結果也逐步完成。
所以 TPU 快的原因,不只是它「算力很強」。
更關鍵的是,它把 AI 最常做的矩陣運算,直接變成一條硬體產線。
這讓我重新理解「AI 晶片」
以前我聽到 AI 晶片,第一個直覺通常是:算力越高越厲害。
但看完 Google TPU 的架構動畫後,我開始覺得,AI 晶片真正有趣的地方,可能不只是「能算多快」,而是整個系統如何把資料送到對的位置,並且用最有效率的方式完成運算。
換句話說,問題不只是:
這顆晶片有多少算力?
而是:
資料要怎麼流? 記憶體要怎麼接? 哪些運算適合交給通用處理器? 哪些運算值得直接做成專用硬體? 而當一顆 AI 加速器真的要被做出來時,又需要哪些公司一起完成?
這也是我覺得 TPU 很值得拆開來看的原因。
TPU 表面上是一顆 Google 自研的 AI 加速器,但如果繼續往下看,它其實會牽出一整條供應鏈:有人負責協助晶片設計與客製化,有人負責讓 HBM 這類高頻寬記憶體靠近運算核心,有人負責先進製程與封裝,也有人提供背後的設備、材料、基板、測試與系統整合。
所以對我來說,理解 TPU 不只是理解一顆晶片,而是理解 AI 時代背後的分工:
Google 定義需求,晶片設計夥伴協助把想法變成可實現的架構,HBM 解決資料餵不飽的問題,台積電與先進封裝把這些元件真正做出來,而更後面,還有一群供應商默默支撐整個系統。
這也是我想寫這個系列的原因。 我想從一個初學者的角度出發,先看懂 TPU 怎麼運作,再一步步往外展開,看見Broadcom、MediaTek、SK Hynix、TSMC,以及整個 AI 晶片供應鏈中那些不一定站在聚光燈下,卻非常關鍵的角色。
理解 TPU,不只是理解一顆 AI 晶片,而是理解 AI 時代背後的整條供應鏈分工。期待這個系列的下一集吧~~~

메타데이터
- post_id
- 398d69c4a9c1
- slug
- cpu-gpu-tpu-的差異-不只是誰比較快-而是資料在硬體裡流動的方式不同-398d69c4a9c1
- url
- https://medium.com/@dualinsightshub/cpu-gpu-tpu-%E7%9A%84%E5%B7%AE%E7%95%B0-%E4%B8%8D%E5%8F%AA%E6%98%AF%E8%AA%B0%E6%AF%94%E8%BC%83%E5%BF%AB-%E8%80%8C%E6%98%AF%E8%B3%87%E6%96%99%E5%9C%A8%E7%A1%AC%E9%AB%94%E8%A3%A1%E6%B5%81%E5%8B%95%E7%9A%84%E6%96%B9%E5%BC%8F%E4%B8%8D%E5%90%8C-398d69c4a9c1
- canonical_url
- https://medium.com/@dualinsightshub/cpu-gpu-tpu-%E7%9A%84%E5%B7%AE%E7%95%B0-%E4%B8%8D%E5%8F%AA%E6%98%AF%E8%AA%B0%E6%AF%94%E8%BC%83%E5%BF%AB-%E8%80%8C%E6%98%AF%E8%B3%87%E6%96%99%E5%9C%A8%E7%A1%AC%E9%AB%94%E8%A3%A1%E6%B5%81%E5%8B%95%E7%9A%84%E6%96%B9%E5%BC%8F%E4%B8%8D%E5%90%8C-398d69c4a9c1
- author_url
- https://medium.com/@dualinsightshub
- status
- ok
- fetched_at
- 2026-06-09 15:37:30