【工作】NVIDIA GTC Taipai 2026 — Day 3
早上先到TICC裡面的露易莎換飲料,前幾天經過的時候看到是包場活動,原來是給人兌換飲料跟給NV的人休息的。
【工作】NVIDIA GTC Taipai 2026 — Day 3
早上先到TICC裡面的露易莎換飲料,前幾天經過的時候看到是包場活動,原來是給人兌換飲料跟給NV的人休息的。




之後再稍微吃點早餐就開始繼續看sessions。
- Inventec、SOLOMON丨真實世界的實體智慧代理 [STW61071]
- Build-a-Claw
- Wistron丨擴大全球製造:物理 AI 引領建廠新潮 [STW61049]
- NVIDIA、TSMC丨Accelerating Industrial Engineering: From Product Design to Manufacturing in the AI Supercomputing Era [STW61011]
- PEGAVERSE丨兩個世界,一個迴圈:Physical AI 的實踐藍圖 [STW61063]
- NVIDIA丨Beyond the Weights: A Hands-On Developer Guide to LLM Serving and Optimization [STW61070]
- NVIDIA丨How to Run Open Models and Agentic AI Efficiently at the Edge [STW61066]
- 結論
- 心得
真實世界的實體智慧代理 [STW61071]
這場內容與 從模擬到工廠:推進機器人移動、導航與智慧決策的落地實踐 [STW61017] 極度雷同,一樣是Inventec和Solomon的session,所以內容我集中在這邊描述。



工廠中可以有各種機器、設備,因此不妨從Problem-driven的角度去想像工廠究竟需要什麼機器,例如:組裝為什麼需要機器人,或者說,為什麼要是人型的,會這樣想是因為直覺上的想像是,整體的流程不變,只是把工廠中的人用機器人取代,也就是說將單點的作業員換成單點的機器人,用機器人試圖在做一模一樣的取代,但這合理嗎?
舉例來說,如果是移動的任務,無人車、車輪、四足可能更好,拿取的任務用五指或是吸盤等,不需要所有都用人形的,如果選擇機器人還是要回歸解決問題本身。我們用人來做為基礎去想像是因為人的彈性最大,可以勝任各種任務,但或許做單一特定種類的任務就不需要這麼複雜的結構,反之,如果要隨時有彈性地去各種支援多種任務,那就要需要複雜的結構,例如:靈巧手。

例如,插定這種任務聽起來很簡單的任務,傳統的作法就是單一角度的視覺,但是要讓機器人能做得好就要多角度的瑕疵檢測也就是要有比較立體的資訊,所以甚至用一個手臂來專門做視覺。 但是除了視覺也要力回饋,因為這種任務從人的經驗上來說,老鳥就是有一種菜鳥沒有的手感,新手就算用了特製的治具也還是會失敗。


這些都是因為插定這個任務不只是2D的任務,用人來比喻,他也涉及所謂的手感。我們需要機器手臂有更多模態的資訊,才能更準確地完成任務。因此,除了收集資料去訓練,在isaac-sim的模擬也很重要,例如根據他們的模擬資料,若每次插定的cycle是1分鐘左右,可以達到95%的成功率,但還是會失敗。

所以瑕疵檢測也可以是立體的視覺,相機就單獨裝在另一隻手臂上,相對於較固定的人眼,這樣的設計更靈活、客製化,針對應用用不同形體。另外,也希望未來這種機器人不只是單點的,而是可以移動去自己插電線,當然要模擬這種軟質的東西比困難。


通常這種要移動的機器會用車來做,但是車會飄移。 飄移的太多,就會讓視覺變得不準確,因為它會超出視覺模型預先的訓練內容,所以為了準確抵達特定的視角,或者說讓機器人到達指定的工位,因此3D空間的精準就很重要,所以要用cuMotion去產生資料訓練模型做路徑規劃。如果車可以自己動,就可以做多角度終端檢查,這樣就比傳統快多了。


然後就是他們的機器人(看起來是宇樹的),實機畫面可以參考Day1的CPTX Booth照片。主要是純用視覺去做事情,因此要串cosmos reason之類的模型,主要是因為需要理解視覺的語意,因為只有視覺,所以需要盡量從中抽取足夠的資訊才能讓機器人自主移動,做這件事情的原因是,目前很多機器人的做任務的前提都是已經在特定工位上,至於他是怎麼到那裡,則是實務上真正的難題。例如,就算VLM、VLA夠強大,那也需要將語意跟人類用自然語言描述的任務整合起來,變成一連串的小任務去驅動機器人,這些都需要cosmos reason。 同時,機器人通常需要邊走邊修正,還有他們稱為超眼力的東西,就是先理解整個畫面大概有甚麼要注意的再來感知。



也有跟其他廠商合作的搬重物的機器人,可以參考【工作】NVIDIA GTC Taipai 2026 出差紀錄,ADLink攤位上有相同的機器人,但是為了現場DEMO的需求,所以是採用遙操的方式。總之,看的出來,solomon作為視覺為主的公司,還是想盡量用純視覺去解決問題。
另外有個比較無關演講內容的小事,就是中間有一度投影片全黑,發現這樣 觀眾自然會去看講者,因為他是唯一能看的東西,或許是一個演講tips。
Build-a-Claw
本來有安排看session,但主題上真的比較無關,所以就去看看NV一直在推薦活動,其實基本上就是純粹Demo Openclaw如何使用和應用,示範可以用DGX Spark就可以跑,後臺可以看到大概佔用30–50GB的RAM,總之想做甚麼就是要有對應的Skill,也都是文檔,也可以上網。


沒有甚麼NV的獨家技術,就是就是DEMO基本操作,例如 Openclaw onboard

https://www.nvidia.com/en-us/ai/build-a-claw/#referrer=vanity
擴大全球製造:物理 AI 引領建廠新潮 [STW61049]
繼續sessions,首先是緯創Wistron



介紹一些工廠相關的應用,FA數位孿生大概的閉環整合 (Closing the Loop),概念是要能夠虛擬環境中real2sim的重現情境,因為這樣才能在模擬環境中做資料分析,包含模擬環境可能的不足,然後再用新的資料去對AI做RL,最後將最新訓練完成的AI策略部署回實體產線,如果有問題,再重複跑這個閉環。概念上其實也有點像是用agent調參,是在模擬中去重現現實,然後訓練AI在部屬回去。
Sync Al則是用來做生產線監控,概念上就是用cosmos把畫面做動作識別,語意分群,就可以找到那個(語意區分出來的)環節耗時,例如步驟三耗費最多時間,這個應用可能也沒有用到甚麼agent,純粹是用新出的cosmos去分析資料。

總之,我們會希望有Physical Al 閉環,它是一個自我優化的智慧產線,每一次人類的決策都回饋為學習訊號,能將action反饋回給agent決策核心。具體來說就是資深工程師根據agent的輸出與解釋,去回饋帶有專業知識的決策給Agent,這樣這些所謂的部落知識就能夠被編碼,或許就只是一份Agent與enginner有共識的一份文件。

因此很重要的就是,每次行動都有可量測的結,因為這是要給agent看的內容,然後agent要有自己的能力去推理思考,如果結果不對,就是補充資料給AI,而不是enginner直接接手把它做到,這樣才能做到人與系統共同進化。
用講者的話來說就是,理想上,Agent 從結果中學習,工程師從 Agent 身上學習,每一個生產循環,都是一次訓練循環— — 雙方皆然。系統每一次行動,都是自己的一堂課,也是站在產線旁工程師的一堂課。
最後QA有討論到真實跟預測總是會不同,那就要不免地要去調模型,但agent重點外還是要有專家,要有有domain knowledge,不然agent可能就只是一直犯錯,實務上先做容易有結果的,熟悉再做困難的。 我自己的想法是,Agent 未必可以知道根因,但是可能可以歸納出總是三種調整方法,那就都試一遍,至少agent從多次協作過程中有歸納一些常見的調整方式,只要能加速agent就有意義。
中午休息吃飯,感覺吃的比前一天好

Accelerating Industrial Engineering: From Product Design to Manufacturing in the AI Supercomputing Era [STW61011]


一開始由TSMC來講用到cuLitho去用GPU加速運算微影(OPC),但這些東西不是很熟,但大方向就是NV提供的lib可以用在某些本來是CPU計算的環節,用GPU加速。



接著回到NV,單純加快運算速度還不夠,工程流程需要高度自動化,所以回到這次活動的主軸,Agentic AI。然後介紹Engineering with AI和一些一直重複出現的案例。



簡而言之,過去的工業工程流程(包含 CAD 設計、前處理、模擬、後處理與分析)是一個極度耗時且仰賴大量人力的線性過程,使用 AI 進行工程設計 (Engineering with AI)則是透過透過將 AI 物理學 (AI Physics) 與 代理型 AI (Agentic AI) 導入工程流程的各個階段,NVIDIA 與其合作夥伴徹底打破了這個瓶頸。具體來說分成
1. 設計階段 (CAD Design)
- 生成式設計 (Generative Design) 與逆向設計 (Inverse Design):傳統設計高度仰賴工程師的直覺與經驗。現在,AI 可以在各個設計階段協助工程師進行更快、更廣泛的設計探索 (Faster and broader design exploration),甚至根據需求自動生成最佳的幾何結構 (Automatically generate optimal geometries)。
2. 前處理階段 (Pre-processing)
- 智能 CAD 準備 (Intelligent CAD Prep) 與智能案例設定 (Intelligent Case Setup):在進行模擬前,工程師通常需要花費大量時間手動清理 3D 模型與設定參數。進入代理型 AI 時代後,系統能在不同階段部署具備特定能力的 AI 代理。工程師只需下達提示 (prompts),代理就能自動清理並簡化幾何圖形 (clean and de-feature geometry),並自動完成複雜的模擬環境設定,大幅減少人工作業時間。
3. 模擬階段 (Simulation)
- AI 預處理 (AI Preconditioning) 與 AI 代理模型 (AI Surrogate):這是虛實整合的技術核心。透過 AI 預處理來加速傳統的物理求解器,並結合 AI 代理模型(如 NVIDIA Physics-Nemo)進行「即時物理預測 (Real-time physics predictions)」,。這項技術能將極度複雜的設備製程(如流體、熱能、電漿等)模擬時間,從過去的數月或數天,驚人地壓縮到只需幾小時甚至幾分鐘。
4. 後處理與分析最佳化 (Post-processing, Analysis and Optimization)
- 自動化報告 (Automated Reports):模擬完成後,AI 代理能自動彙整龐大的數據、生成視覺化圖表並提取洞察,自動編譯成報告。
- 過去,工程師常因為開發時程的「死線 (deadline)」到了而被迫停止設計;現在,極速的模擬與自動化分析讓工程師能進行更多次的迭代,從而找出真正最佳的產品方案,而不僅僅是「堪用」的產品。


另外有著重介紹PhysicsNemo,也就是NV推出的AI Physics,把它用在Physical AI Surrogate,有點饒口,簡單來說就是訓練一個AI充當物理模擬器,只要每個步驟都夠快,就有機會讓現實跟虛擬表現一致,做到Digital Twin。

Physical AI分成兩個視角,Inside-Out AI跟 Outside-In AI,去年也有聽過,今年比較具體,前者指的是Digital Twin,也就是每個實體本身就具有智能,例如機器人,由內而外的去跟現實、虛擬世界互動,後者則是Vision AI Agents,就是有一個帶有視覺理解能力的agent,由外而內的去觀察物體,物體本身可能並沒有任何智能。
其他就是一些NV傳統藝能,一堆藍圖。整場英文,所以沒有很懂,後期用AI整理一些上述的資料。
下午茶時間~


兩個世界,一個迴圈:Physical AI 的實踐藍圖 [STW61063]
和碩 PEGAVERSE,感覺他們的session名稱都有點裝逼。

提到World Model,講者的說法跟我的理解【Cosmos】在神經科學中World Model比較一致,world model並不是一個客觀模擬器,去年GTC TPE Day2 Foxlink的話來說,這些world model在預測未來的時候就是在做夢。
換言之,有真實的世界跟心裡的世界,我們不會期望心理的世界真的能做到真實世界般的精準,而是要能夠對未來發生的事情有合理的預期,這個概念講者引用ReAct: Synergizing Reasoning and Acting in Language Models (2022)說明

簡單來說就是LM要自己有reasoning能力,同時能夠做出action與接收環境的回饋,否則就是行而不思則罔,或是思而不行,應該要做到知行合一。前者概念上有點像是是頭腦簡單四肢發達,後者是思想的巨人行動的侏儒,因此 General Agents需要內心應該有自己想像中的世界,也就是world model。

類似的概念是可以追溯到 Dyna (1991), Richard S. Sutton — ‘Dyna, an Integrated Architecture for Learning, Planning, and Reacting’


回到現在,就是用real world去更新policy model跟world model,最終再讓後者去更新前者,有趣的是,講者有歸納很多world model,用representation跟condition去區分,綠字則是NV的。

由此可知,都叫做world model其實還是分別很大,就算是NV出的也不見得都指的是同一種world model。接著就一樣是一堆應用的介紹




這邊值得一提的是,比較常見的world-model是Pixel based,或者是說用pixel represent的,這種world model如果面對沒有在訓練時看過外觀的東西,例如一顆材質怪異的球,,那就會模擬得亂七八糟,但simulation based 的就比較不會,但反之,我們就需要調參數,所以要用Sim Parameter Optimizer,來用用Agent 來找、調整參數。




另外,合成資料可以在前期快速把準確度提升。訓練出來的AI可以偵測到很多過去沒辦法偵測的東西,例如偵測手碰到晶片。agent也可以用在給document 就可以讓AI在虛擬空間中去組裝看看。
總而言之,真實世界跟虛擬世界的差別在於前者太不可預測,太多變因

因此,在機器狗的情境中,它的policy model都會預先在模擬環境中經過20000+的iteration。


還會需要加一些雜訊和domain randomization,但仍要收集真實世界的資,這些回饋都要拿來訓練policy model,具體來說,就是發一個實際的訊號,然後依據實際的行動得到真實世界的回饋,要持續訓練。這是因為有很多訊號來自真實世界的不可預測,比如說IMU的noise 現實世界有各種誤差,要用現實世界的sensor去蒐集資料,然後紀錄回去訓練policy model,舉例來說,把這些訊號都錄下來,發現最後可能要回去調整機器狗的重心。


最後講者的總結是引用這句話
如果生物能在腦中建立一個關於外部世界與自身行動的微縮模型,它就能在心中模擬不同的選項,找出最佳方案,甚至在事情發生前就預先反應。
我覺得挺好的,我相關的後續討論集中在【Cosmos】在神經科學中World Model
中間去看一下似乎有免費的課可以上,其實就是掃右上的QR Code,大概分成兩種類型,都可以選一門課上


具體來說是
- https://sp-experience.courses.nvidia.com/GTC2026Taipei?ncid=ref-qr-906736
- https://gtctaipei.nvacademy.dev/courses/infrastructure
要注意的是,他們對應的平台其實不同
這個我也不懂為什麼NV有兩個上課平台。
Beyond the Weights: A Hands-On Developer Guide to LLM Serving and Optimization [STW61070]
針對現在大量的agent,如何有效的去處理這種龐大的LLM服務,感覺跟AI Factory Tokenomics Explained [STW61054]有關,因為如何有效的使用token其實實作上不外乎就是要cached之類的服務最佳化。




沒有聽得很懂,因為過去沒有自己架過LLM,但整體上聽得出來是用最單純的LLM案例一路延伸到複雜的架構,為了要應付大量需求,然後有許多機制可以用來節省資源,例如,為了解決代理型 AI 特有的延遲與資源消耗問題,發展出了三項關鍵技術:
- 推測解碼 (Speculative Decoding):利用一個較小、較快的「草稿模型 (Draft model)」先猜測後續的字詞,再交由大模型一次性驗證。這讓原本一次只能生成 1 個代幣的解碼步驟,能一次產出 2 到 3 個代幣,大幅降低延遲。
- KV Cache 重用 (KV Cache Reuse):代理 AI 經常呼叫外部工具(如執行程式),在等待工具回傳結果時,伺服器必須保留之前的短期記憶(KV Cache)。當新一輪對話開始時,系統可以直接「重用」這些記憶,免去重新計算龐大提示詞的時間。
- 分離預填充與解碼 (PD Disaggregated Serving, DSA):過去,閱讀長提示詞(預填充 Prefill)與生成回答(解碼 Decode)都在同一張 GPU 上進行。當某個代理輸入超長提示詞時,會導致其他正在生成回答的使用者卡頓。DSA 技術將「預填充」與「解碼」分配到不同的 GPU 伺服器上獨立運作,大幅提升流暢度。
我相信講者應該是講得蠻深入淺出的,只是我沒有相關知識,所以就是看個熱鬧。
How to Run Open Models and Agentic AI Efficiently at the Edge [STW61066]
現場的講者好像是Yocto的人



DGX Spark是用來模擬跟finetune的,Jetson則是部署,而現在在Jetson中可以運行agent,內含相關知識跟skill可以讓你快速部署和最佳化用來幫助使用者部屬和各種最佳化。


Yocto他們應該是基於Jetson的這些新特性去提供客製化的方案,讓客戶可以快速部署並最佳化。




有趣的是最後有一個現場DEMO的環節,就是把在jetson中去real-time模擬機器人Agent,現場插相機、麥克風,很快就可以工作,讓機器人照著現場的指示行動,例如怎麼走,怎麼疊東西。同時也可以用自己的手機去檢視,主要就是DEMO 他們能用Jetson跑模擬、AI和串流。




結論
基本上還是圍繞在agent上,並試圖引入agent去推進Physical AI,無論是NV在[STW61011]中提到的inside-out或是outside-in的agent,前者例如英業達和所羅門在[STW61071]做的,讓機器人本身就是agent,足夠聰明去跟世界互動,無論是虛擬或是現實。後者則像是緯創在[STW61049]提到的,用cosmos把畫面做語意分群,當然,這兩者不是互斥的,所以多數公司都會嘗試去做。
總之,Physical AI的前置就是要有Digital Twin,因為成本等種種原因,這個部分可能【工作】NVIDIA GTC Taipai 2025 出差紀錄 就有提到這邊不贅述,可以理解Digital Twin就是和碩在[STW61063]提到的兩個世界,除了現實世界之外,我們可能會有電腦中的世界,也有agent腦中的世界,都要視我們的AI需要甚麼樣的世界,並串聯在一個迴圈中,迭代優化AI的能力、世界的真實度、人類的領域知識,每個環節理論上都要越來越好。
這是因為但是Digital Twin本身也是一個需要不停迭代、同步、對齊的事情,這件事情人工成本仍然很高,因此會希望引入agent來做這些重複性優化的事情,這個道理可以放在inside-out和outside-in的agent中,希望可以由人提供領域知識來讓agent和結果越來越好。
因此,[STW61011]從Engineering with AI去舉例,agent是如何加速整個流程,而到了更上游,[STW61066]介紹如何有效率的部屬和運行agent在edge,[STW61070]則是介紹要如何有效率的run agent在比較集中的server中,例如AI factory。
心得
回到我自己的工作上,概念延續Cooler Master、SPINGENCE丨從虛擬到現實:全球 AI 工廠的崛起 [STW61018]和[STW61049],概念上,我自己的工作方法也是類似的概念,要先把流程圖畫出來,把每個環節都列出來,然後用某種方式把目前具體做的事情語意分類到個別環節,這樣才能做進一步的分析,知道哪個部分是瓶頸、是重要的。
另外,有三場的講者(公司)去年也有來,其實調性上差不多
- Solomon丨Turning Al Models Into Smarter Robots Powered by One Unified Platform
- Wistron丨運用 NVIDIA Omniverse 和 Metropolis 多攝影機追蹤工作流程提升設備、機械手臂與人員的工作效率
- Pegatron丨AI 與 Digital Twins:通往自主化之路
所羅門繼續做人形機器人的視覺,緯創則是一直丟各種應用出來,但結果難免讓人覺得有些持保留態度,和碩則是調性上比較文藝一些。
感謝你的閱讀,如果你對我的文章對你有所幫助或是意見歡迎回覆,如果你想要支持我可以:
- 拍個手👋,或是分享一些想法💬
- 追蹤我的頁面
- 訂閱我的專欄
- 透過LinkedIn聯繫我
或是觀看我其他系列文章
- 【工作】NVIDIA GTC Taipai 2026 — Day 2
- 【工作】NVIDIA GTC Taipai 2025 出差紀錄
- 【工作】NVIDIA GTC Taipai 2025 — Day 0:Building Digital Twins for Physical AI With NVIDIA Omniverse
- 【Omniverse Farm】Omniverse Farm學習筆記 — 00:OVX
- 【Omniverse Farm】學習筆記 — 01:Using Movie Capture to Render
- 【Omniverse】學習筆記 — 00:Kit-based Development
메타데이터
- post_id
- c23d4256bd3d
- slug
- 工作-nvidia-gtc-taipai-2026-day-3-c23d4256bd3d
- url
- https://medium.com/@maochinn/%E5%B7%A5%E4%BD%9C-nvidia-gtc-taipai-2026-day-3-c23d4256bd3d
- canonical_url
- https://medium.com/@maochinn/%E5%B7%A5%E4%BD%9C-nvidia-gtc-taipai-2026-day-3-c23d4256bd3d
- author_url
- https://medium.com/@maochinn
- status
- ok
- fetched_at
- 2026-07-13 06:23:13