0

0
1

文字

分享

0
0
1

用十分鐘向 nand2tetris 學會設計處理器

PanSci_96
・2016/03/12 ・97字 ・閱讀時間少於 1 分鐘

-----廣告,請繼續往下閱讀-----
文章難易度
PanSci_96
1294 篇文章 ・ 2683 位粉絲
PanSci的編輯部帳號,會發自產內容跟各種消息喔。

0

0
0

文字

分享

0
0
0
AI 可以設計散熱,但誰敢讓它出貨?林唯耕談算力背後的物理現實
鳥苷三磷酸 (PanSci Promo)_96
・2026/08/20 ・2819字 ・閱讀時間約 5 分鐘

本文由 高柏科技 合作,泛科學撰文

林唯耕剛回台灣任教時,曾在清華大學的實驗室裡用一立方公分的「氨」做實驗。沒想到氨氣意外洩漏,那股刺鼻的氣味瞬間瀰漫整棟大樓,引來眾多師生抗議。

「從此以後,我再也不敢在實驗室裡用氨了。」他在《思想實驗室》的訪談中,帶著笑意回憶這段往事。

這段插曲聽來像是一則工程師的寓言:在理論模型中,氨是太空熱控系統的理想介質;但在現實的辦公大樓裡,它首先是逼人逃竄的臭味。公式本身沒有錯,但現實世界永遠比公式更複雜——它包含了人、成本、風險,以及必須為後果負責的工程師。

-----廣告,請繼續往下閱讀-----

高柏科技技術專家、清華大學榮譽退休教授林唯耕 ,曾任職於美國 OAO 工程部熱流組,深耕電子構裝散熱與熱管技術多年。隨著 AI 浪潮席捲全球,他鑽研一輩子的老問題再次被推向科技產業的核心:當晶片運算速度無止境攀升,那股伴隨而生的熱,究竟該往哪裡去?

熱不會讀新品發表會

科技巨頭在發表會上熱衷於談論大型語言模型、GPU 規格與驚人的算力。這些詞彙在投影片上光鮮亮麗,彷彿進步毫無邊界。然而,每一次數位運算都紮實地發生在實體晶片上。晶片會發熱、材料會疲勞老化,一旦設備過熱,系統便會降頻保護。在物理現實面前,再動聽的發表會敘事也必須低頭。

晶片會發熱、材料會疲勞老化,一旦設備過熱,系統便會降頻保護 / 圖片:envato

回顧個人電腦發展早期,晶片幾乎不需專屬散熱元件。隨後,鋁製鰭片、風扇、熱管到均溫板逐一登場。這段歷程常被視為技術升級,其實更像是對空間的極限勒索:晶片功率翻倍,發熱源的面積卻沒變大,機箱空間也不可能無限擴張。

林唯耕指出,散熱設計的核心只有三要素:功率、熱源面積與空間限制。他舉例,在標準的 1U 機箱中,若發熱面積約為三十乘三十毫米,氣冷系統在達到八百瓦時就會面臨瓶頸。這並非固定的物理常數,而是取決於空間、面積與氣流的動態平衡。最現實的代價在於,風扇轉速提升的背後,是噪音、電力損耗與空間占用。

-----廣告,請繼續往下閱讀-----

因此,「液冷技術」的興起並非單純為了追求酷炫,而是算力密度提升後的必然選擇。它能更精準地帶走晶片廢熱,卻也將新的挑戰帶入機房:漏液風險、流道堵塞、材料相容性,以及維運時的難度。工程的進步,本質上鮮少是徹底消滅問題,更多時候是選擇一組「比較值得承擔」的新問題。

太空教他的,不是把答案搬回地面

太空熱控工程之所以迷人,是因為它剝奪了地球上最常見的散熱工具。在真空宇宙中,沒有空氣能讓風扇製造對流;受光面溫度破百度,陰影處卻極度嚴寒。工程師必須純粹仰賴熱傳導、熱輻射,以及熱管與環路型熱管(LHP)來搬移熱能。

熱管運作的關鍵在於「相變」——液體蒸發時吸收大量潛熱,冷凝後重回循環。林唯耕比較了銅與水的熱傳導能力:在他設定的特定條件下,實心銅塊約能傳導 120 瓦的熱能;但若每秒有一立方公分的水發生蒸發相變,移熱量可瞬間拉升至 2.4 千瓦(kW)。他強調「每秒」的觀念,因為散熱談的是動態流動速率,而非靜態的冷卻魔法。

儘管如此,太空科技並不能直接套用到地面。太空元件因考量重量、功耗與維修難度,偏好無馬達幫浦的被動式設計;但地面 AI 伺服器面臨更高的熱負載與環境溫度,往往仍需幫浦驅動流量。當年那場「氨氣洩漏」事故正是最好的提醒:技術是否「先進」,與它是否「適合」當下的場景,始終是兩回事。

-----廣告,請繼續往下閱讀-----
他強調「每秒」的觀念,因為散熱談的是動態流動速率,而非靜態的冷卻魔法。/圖片:envato

好論文,為什麼仍可能造不出好產品

學術研究致力於證明「可行性」,而工業現場則要求「可重複性」——不僅要能運作,還得確保每台出廠的設備都不漏水。林唯耕將此定義為「從 0 到 1」與「從 1 到 100」的差別。後者涉及良率、成本、公差與客戶信任。論文中那次最完美的實驗數據,在產線上往往未必管用。

他從不避談失敗。在高柏科技早期與學界合作時,也曾遇過實驗數據無法複製,或研究方向偏離產業需求。這未必是雙方努力不夠,而是彼此對「成功」的標準不同。為了解決這道鴻溝,高柏科技推動「柏苗啟航創新培育計畫」,每年投入逾千萬資金與成大、中山、台科大等校合作,並指派專業人才在過程中持續微調、校正,確保研發貼近產線現實。

他分享了近期一項液冷工質校正專案。團隊使用非侵入式的超音波流量計進行觀測,但由於儀器預設以「水」校正,換成其他化學流體後讀數便出現誤差。最初嘗試用幫浦壓差推算,卻發現缺乏重複性,數據甚至推導出不合理的蒸發率。最後團隊回歸基本面,改用秤重法搭配能量平衡進行交叉驗證,才讓數據成功收斂。

這個故事真正的價值不在於「產學雙贏」的口號,而在於那段不夠優雅的挫折:假設失效、數據混亂、方法砍掉重練。也正是在這種時刻,企業需要的不只是會算數的人才,而是能洞察研究何時「走鐘」,並有權力喊停、要求重來的關鍵決策者。

-----廣告,請繼續往下閱讀-----

林唯耕坦言,過去在校園裡總認為「技術第一、成本第二」,進入商界後才驚覺行銷與信任關係往往才是關鍵。這番話雖然不如科技突破那樣動聽,卻是產品能否進入市場的殘酷真相。再卓越的散熱設計,若無法穩定生產或贏得客戶信任,也僅止於一份精美的報告。

AI 會給答案,誰來負責出貨?

訪談尾聲,主持人國威提出了一個時代難題:假設 AI 能在彈指間生成散熱架構、材料配方與流道設計,企業該選擇全面擁抱 AI 的速度,還是保留緩慢但穩定的工程驗證,以規避潛在的失效風險?

林唯耕拒絕落入二選一的框架。他的觀點是:兩者並存。AI 擅長處理資訊、生成草案;但工程師仍須實作原型,進行嚴苛的性能與可靠度測試,最終由人決定是否出貨。這並非盲目崇拜人類直覺,而是基於一項事實:AI 的資料庫裡,通常沒記載下一次「意外洩漏」或「材料疲勞」的細節,且模型永遠無法為量產結果擔負法律與商業責任。

在 AI 時代,最稀缺的未必是熟練下指令(Prompt)的人,而是具備這種能力的人:能預判答案可能在哪裡出錯、能設計實驗將問題「逼」出來,並且願意為最終的量產品質負起責任。

-----廣告,請繼續往下閱讀-----

大眾習慣將雲端想像成輕盈、無重量的空間。但現實中,雲端是由龐大的機房架構而成,裡面裝滿了晶片、管線、泵浦與冷卻液。虛擬算力的每一次擴張,都會在實體世界留下發熱的足跡。散熱工程師的價值,就是不讓這筆物理帳單,被埋沒在光鮮亮麗的投影片背後。

-----廣告,請繼續往下閱讀-----
文章難易度

討論功能關閉中。

0

3
1

文字

分享

0
3
1
Google Tensor 處理器是什麼?厲害在哪?
PanSci_96
・2023/04/08 ・2920字 ・閱讀時間約 6 分鐘

 Google 新出的 Pixel 7 Pro,其核心繼續沿用上一代開始自行研發的晶片,並且升級為 Google Tensor G2。

由 Google 開發、號稱專為 AI 設計打造的 Tensor 晶片,尤其著重在 TPU。打開處理器 Google Tensor 一探究竟,裡面放著 CPU、GPU,以及擁有 AI 運算能力的 TPU(Tensor Processing Unit)張量處理單元。

什麼是 TPU?與 CPU、GPU 有什麼不同?要了解 TPU,先來看看他的前輩 CPU 和 GPU 是如何運作的吧!

TPU 處理器晶片是什麼?先從了解 CPU 開始!

不論手機、電腦還是超級電腦,當代計算機的通用架構,都是使用以圖靈機為概念設計出來的馮紐曼架構,這個程式指令記憶體和資料記憶體合併在一起的概念架構,從 1945 年提出後就一直被使用到現在。

除了輸入輸出設備外,架構中還包含了三大結構:記憶體 Memory、控制單元 CU 與算術邏輯單元 ALU。在電腦主機中,控制單元 CU 和算術邏輯單元 ALU 都被包在中央處理器 CPU(Central Processing Unit)中;記憶體則以不同形式散佈,依存取速度分為:暫存器(Register)、快取(Cache)、主記憶體(Main memory)與大量儲存裝置(Mass storage)。

-----廣告,請繼續往下閱讀-----
馮紐曼架構(Von Neumann architecture)。圖/Wikimedia Commons

算術邏輯單元 ALU 負責運算,透過邏輯閘進行加減乘除、邏輯判斷、平移等基礎運算,透過一次次的運算,完成複雜的程式。有了精密的算術邏輯單元,還有一個很重要的,也是控制單元 CU 最主要的工作——流程管理。

為了加速計算,CU 會分析任務,把需要運行的資料與程式放進離 ALU 最近、存取速度最快的暫存器中。在等 ALU 完成任務的同時,CU 會判斷接下來的工作流程,事先將後面會用到的資料拉進快取與主記憶體,並在算術邏輯單元完成任務後,安排下一個任務給它,然後把半完成品放到下一個暫存器中等待下一步的運算。

CPU 就像是一間工廠,ALU 則是負責加工的機器,CU 則作為流水線上的履帶與機械手臂,不斷將原料與半成品運向下一站,同時控制工廠與倉庫間的物流運輸,讓效率最大化。

然而隨著科技發展,人們需要電腦處理的任務量越來越大。就以照片為例,隨手拍的一張 1080p 相片就含有1920*1080 共 2073600 個像素,不僅如此,在彩色相片中,每一個像素還包含 R、G、B 三種數值,如果是有透明度的 PNG 圖片,那還多一個 Alpha 值(A值),代表一張相片就有 800 萬個元素要做處理,更不用說現在的手機很多都已經能拍到 4K 以上的畫質,這對於 CPU 來說實在過於辛苦。

-----廣告,請繼續往下閱讀-----
很多照片都有 4K 以上的畫質,這對於 CPU 來說實在過於辛苦。圖/Envato Elements

由於 CPU 只有一條生產線,能做的就是增加生產線的數量;工程師也發現,其實在影像處理的過程中,瓶頸不是在於運算的題目過於困難,而是工作量非常龐大。CPU 是很強沒錯,但處理量能不夠怎麼辦?

那就換狂開產線的 GPU!

比起增加算術邏輯單元的運算速度,不如重新改建一下原有的工廠!在廠房中盡可能放入更多構造相同的流水線,而倉庫這種大型倉儲空間則可以讓所有流水線共同使用,這樣不僅能增加單位體積中的運算效能,在相同時間內,也可以產出更多的東西,減少一張相片運算的時間。

顯卡大廠 NVIDIA 在 1999 年首次提出了將圖形處理器獨立出來的構想,並發表了第一個為加速圖形運算而誕生、歷史上第一張顯卡—— GPU(Graphics Processing Unit)NVIDIA GeForce 256。

在一顆 GPU 中會有數百到數千個 ALU,就像是把許多小 CPU 塞在同一張顯卡上;在影像處理的過程中,CU 會把每一格像素分配給不同的 ALU,當處理相同的工作時,GPU 就可以大幅提升處理效率。

-----廣告,請繼續往下閱讀-----

這也是為什麼加密貨幣市場中的「礦工」們,大部分都以 GPU 作為挖礦工具;由於礦工們實際在做的計算並不困難,重點是需要不斷反覆計算,處理有龐大工作量的「工作量證明機制」問題,利用 GPU 加速就是最佳解。

不過,影像處理技術的需求隨著時代變得更加複雜,這就是人工智慧的範疇了。以一張相片來說,要能認出是誰,就需要有一道處理工序來比較、綜合諮詢以進行人臉辨識;如果要提升準度,就要不斷加入參數,像是眼鏡的有無、臉上的皺紋、髮型,除此之外還要考慮到人物在相片中的旋轉、光線造成的明暗對比等。

人臉辨識是人工智慧範疇。圖/Envato Elements

每一次的參數判斷,在機器學習中都是一層不同的過濾器(filter)。在每一次計算中,AI 會拿著這個過濾器,在相片上從左至右,從上至下,去找相片中是否有符合這個特徵;每一次的比對,就會給一個分數,總分越高,代表這附近有越高的機率符合過濾器想找的對象,就像玩踩地雷一樣,當這邊出現高分數的時候,就是找到目標了。

而這種方式被稱為卷積神經網路(Convolutional Neural Networks, CNN),為神經網路的一種,被大量使用在影像辨識中。除了能增進影像辨識的準確度外,透過改變過濾器的次數、移動時的快慢、共用的參數等,還可以減少矩陣的運算次數、加快神經網路的計算。

-----廣告,請繼續往下閱讀-----

然而即便如此,工作量還是比傳統影像處理複雜多了。為應對龐大的矩陣運算,我們的主角 TPU(Tensor Processing Unit)張量處理單元就誕生了!

TPU 如何優化 AI 運算

既然 CNN 的關鍵就是矩陣運算,那就來做一個矩陣運算特別快的晶片吧!

TPU 在處理矩陣運算上採用脈動陣列(Systolic Array)的方式;比起 GPU 中每個 ALU 都各做各的,在 TPU 裡面的資料會在各個 ALU 之間穿梭,每個 ALU 專門負責一部分,共同完成任務。這麼做有兩個好處,一是每個人負擔的工作量更少,代表每個 ALU 的體積可以再縮小;二是半成品傳遞的過程可以直接在 ALU 之間進行,不再需要把半成品借放在暫存區再拿出來,大幅減少了儲存與讀取的時間。

在這樣的架構下,比起只能塞進約 4000 個核心的 GPU,TPU 可以塞進 128*128 共 1.6 萬個核心,加上每個核心負擔的工作量更小,運算速度也就更快、耗電量更低。我們經常使用的 google 服務,許多也是用了 TPU 做優化,像是本身就是全球最大搜尋引擎的 google、google 翻譯、google map 上都大量使用了 TPU 和神經網路來加速。

-----廣告,請繼續往下閱讀-----
Google 服務大量使用了 TPU 和神經網路來加速。圖/GIPHY

2021 年,Google 更把 TPU 導入到自家手機產品中,也就是前面我們提到的 Google Tensor;今年更是在 Pixel 7 中放入升級後的 Google Tensor G2。

Google 表示新款人工智慧晶片可以加快 60% 的機器學習速度,也加快語音助理的處理速度與增加功能、在通話時去除雜音增進通話品質等,不過最有感的還是圖像處理,像是透過 AI 多了修復模糊處理,不僅可以修正手震,還能把舊相片也變得清晰。

現在新款的手機為凸顯不同,越來越強調自家晶片設計與效能的差異;除了 Google 的 TPU 外,其他公司也朝著 AI 晶片的方向前進,包括蘋果、高通、聯發科、中國的寒武紀等,也都發表了自行研發的神經網路處理器 NPU。

歡迎訂閱 Pansci Youtube 頻道 獲取更多深入淺出的科學知識!

-----廣告,請繼續往下閱讀-----