← Back to list

【工作】SIGGRAPH Asia 2024 — Day 1

之前誤刪到,還好之前有備份,只是圖片部分沒有保留到,所以有些東西圖片可能跟之前不一樣

帽捲 in Maochinn · 2026-05-18 15:30 · 0 claps · 12.2 min read paywalled
#siggraph #tokyo #computer-graphics #business-trip #siggraph-asia
Open on Medium ↗

【工作】SIGGRAPH Asia 2024 — Day 1

之前誤刪到,還好之前有備份,只是圖片部分沒有保留到,所以有些東西圖片可能跟之前不一樣

比較整體的整理跟心得在【工作】SIGGRAPH Asia 2024 東京出差紀錄 / 攻略指南中有說明過,所以各日的筆記會比較像流水帳,但是個別活動也會有比較詳細的說明。

目錄

這次SIGGRAPH Asia的地點是在東京國際論壇(Tokyo International Forum),我在【旅遊】Love Live 虹咲 7th Live + 東京四日遊有特定繞過去看看,會場基本上分成兩棟,中間有一些連接橋,但也可以走平面來往。

Technical Papers Fast-Forward and Awards

第一天早上先跟來自中研院的Student volunteer碰個面,之後他就去排班了,而我則是去Hall C參加Technical Papers Fast-Forward and Awards,可以在門口拿到一本本子,會依據不同主題分類所有入選的papers,順序也大致是照上面走。

一開始算是整個Conference的開幕式,介紹的同時也有頒一些獎,比較特別的是,paper的數量每年都在上升,而我也貢獻了2023的其中之一,雖然沒有被accepted。

子領域上還是以影像、rendering居多,然後才是Modeling,畢竟近年的AI盛行,尤其是影像上的。

介紹完之後就開始Fast Forward,有些組別是預錄的影片,也有些是現場講的,但都不會講很久,我印象中表定是限制一分鐘,但是體感上應該都不到一分鐘,比較有趣的是有一組宅到不行,插入一堆樂團動畫的截圖,居然到了Siggraph都還在GO。

有些組別會塞梗,但是也有比較傳統的介紹,甚至有組別直接不講內容,因為每篇paper在之後會有專門的活動會詳細講10分鐘左右,所以就不暴雷。整個活動表定是從早上9:00 ~ 12:00,基本上一小時後就開始精神就有點渙散,雖然中間會有5分鐘左右的break。

BUSINESS MATCHING

之後,就是我在BUSINESS MATCHING PLATFORM中約到的榮教授,他是來自Meta Tech Lab的華人,可能這是我第一次約人,講話有點顛三倒四,還好教授很穩,也發現我們過去都有自駕車的經驗,他分享了現在在Meta則是處理比較底層graphics的問題,例如buffers的combination,教授也是第一次來SIGGRAPH Asia,過去都是參加北美的。

緊接著是見了來自香港的sales,她也是第一次來,針對我公司產品產生出來的metadate相對有興趣,或許可以包起來當training data賣,雖然應該十分小眾。後來也聊到台灣的AI相關的budget,相比日韓中國來說,似乎都不大。

最後是來自台灣的兩位工程師,分別是ios與learning工程師,前者過去碩士也是圖學背景,對於台灣的圖學出路心有戚戚焉,所以才轉成ios,主要示範了自家產品跟開發中的beta功能,將圖片做style transfer,也有討論到AI與CG結合的看法,但主要還是著重在CV,例如diffusion model。

整個上午基本被塞滿了,早餐就是直接買超商,雖然主要是因為會有收據可以報帳,之後開場9:00~11:00是fast-forward,接著每組約見面的人大概半小時,所以結束後就趕快去吃午餐了。下午剩下的時間活動就是去看Birds of a Feather (BoF),因為我的Pass不能看technical papers的presentation,也有注意到大多數人都是大家都是full pass。

Learn OpenUSD: Developing Data Exchange Pipelines

下午去的第一個活動是NVIDIA有關於OpenUSD的活動,主要也是因為最近有在學相關的東西,但比較尷尬的是,到了教室所有人都在用電腦學習,講者則是在前面開了Jupyter,類似於【Omniverse】學習筆記 — 03:OpenUSD中的那種course,其中一個要做obj轉usd。

Future of Hybrid Society: How Digital Twin and XR Will Shape Our Society

後來我就跑去參加另一個BoF,但是因為我比較晚到,整個教室爆滿,,主要是有關於Digital Twin跟XR的應用,第一個presentation似乎是一個XR的應用,一個人在現實中拉小提琴,然後重建後放到虛擬場景中,可以讓人用XR來看。

Sony Deep Generative AI

第二個presentation的講者提出三個問題Slow Genetation, Scalability, Application。分別的解方是

  • CTM,主要是針對diffusion model太慢的問題,可以不需要慢慢denoise,不只是變得更快,甚至有時品質會更好,因為慢慢denoise有時候會過度產生一些連續平滑。
  • PaGoDA,解決的問題是如果要diffusion model能夠產生更高解析度的圖片時,基本上只能重train,解決方法就是一樣用低解析度的diffusion model,但是在decoder的後半段多加layer,然後只多train後半段
  • GenWarp,偏應用,主要是輸入一張室內圖,然後合成出不同角度的視角,不是重建,強調的點在於可以保留許多semantic detail,例如文字不會壞掉。

Acceleration Science using AI, Digital Twins

第三個presentation是NVIDIA帶來的內容,但其實就是對外宣傳的那些內容,比較著重在加速運算、模擬、Omniverse之類的。

Collaboration with Captured Reality

蠻有趣的,講者從35年前的如何capture講到現在,從Photos, Movies, 3D Photos, Depth Sensing, 360 Movies再到現在的3D Capture,提出有趣的例子是Digital Twin可以用在增強遠端協作

例如View Sharing Evolution,也就是操作者是使用AR view,而Remote expert是使用VR view,從共用一個2D view,到使用360環景的view,讓remote的人可以用不同的視角去互動,再到近年的直接將3D重建出來,讓remote的人可以直接在3D空間中互動。

針對這種mataverse的paper,可以用兩個維度大致分成四類,兩個維度分別

  • X軸: Externals ←→ Intimate
  • Y軸: Simulation ←→ Augmentation

在四個象限依序為Lifelogging、 Augmented Reality、Mirror Worlds/Digital Twin以及Virtual Worlds,舉個例子來說,第一象限是Lifelogging,通常較需要與身體有親密的接觸,同時以捕捉到的資訊進一步擴增、分析生命的資訊。

但這四種在Metaverse中的占比分別為2%, 10%, 12%和36%,換言之,還是以Simulation為大宗,其中又以VR明顯更多,進一步來看,同時涵蓋Digital Twin+AR+VR+Sensing這些技術的只<2%

但講者認為,這些技術應該未來會同時使用,其中一個應用就是Empathic Computing,分成三個Key elements

  • Understanding: Sensing
  • Experiencing: Digital Twin/VR
  • Sharing: AR

簡單來說,為了要理解環境,就需要使用sensing,不只是要堆sensor,也要用AI去有效的感知,在沉浸式的體驗上,還是得靠VR的技術,最後,要跟其他人互動的時候,則是使用AR,因此現在比較新的發展是Sensor Enhanced AR/VR HMD。

Discover Next-Gen 3D Modeling with 3D Gaussians

有三個presentation,討論的主題就是下一個世代的3D Gaussian Splatting

FOUNDATIONS AND RECENNT ADVANCES OF 3D GAUSSIAN SPLATTING

第一個presentation就是介紹一下3DGS的基礎以及目前遇到的問題,開頭給了定義,GS是novel-view synthesis,換言之,不是reconstruction,儘管從結果上來看他很像是重建,但GS的目標是任意角度的合成,換言之。他並不需要能夠真正的重建出完整的3D,可以無死角的完整重建,而是用合成的方式想辦法在任意角度能夠觀看,但通常不會是無死角的檢視。

而GS的好處是Easy initialization,不用meshing,也就迴避掉很多topology的問題,初始點通常用SfM,但也可以用random points,在rendering上,explicit的幾何加上implicit的外觀不只有很好的視覺效果,前者本身explicit的表示就可以快速rendering,後者可以使用以前的EWA splatting、EWA Volume splatting,將3維的分布利用數學性質壓扁到2D去計算,因此可以讓rendering的效率很好。

因此這個技術在近年竄升的很快,它的用處主要分成三塊與其它應用

  • Dynamic Scene: 因為幾何上不是使用mesh,少掉很多幾盒上的麻煩,所以應用在動態場景很適合。
  • Inverse Rendering and PBR Gaussians (Relighting): 其實3D GS應該就是從IR延伸出來的技術,因此當然可以跟其他IR的方法結合,也可以擴展成synthesize PRR的材質,進一步的應用之一就是relighting。
  • Generative AI for 3D Content: GS通常來自於differentiable rendering,同時其表示形式這些特性都很適合用在GenAI

但還是有問題,其中一個是popping artifacts,因為使用alpha shading,就會有前後的問題,那在depth cross的時候就會產生popping

另外,GS的一大弱點是關於記憶體的使用,因為幾何是用explicit表示的,換言之,幾何的資訊需要確實的儲存空間,在小規模的情境的確目前都沒有大問題,接下來如果規模近一步擴大到城市,那麼還是要處理效率的問題,例如HIERARCHICAL 3D GAUSSIAN SPLATTING,像是LOD,可以在比較遠的時候用將多個splat合併成一個splat,維護一個tree的結構。

另一個方向是使用更少的input來做到好的結果,利用一些現實特性,例如利用epipolar的pixelSplat、直接用transformer的:GS-LRM、LONG-LRM

Advances in Photo-Realistic 3D Avatar Creation: From Gaussian Splatting to Generalizable 3D Heads

因為比較少接觸人臉、人頭相關的應用,所以比較沒有太多想法,就稍微紀錄一些,合成的流程大概分為

  • Capture
  • Gaussian Avatars
  • Neural Parametric Models
  • Neural Gaussian Avato
  • 3D Generation

HarmonyOS NEXT Graphics Technology (ArkGraphics) Architecture and Key Challenges

大意就是高空講了一些CG、CV fusion的歷史,然後開始放一些非常複雜的架構圖,不知道是不是想要唬住觀眾,但在座都是CG的專家,拿這種系統之類的圖出來不知道想表達甚麼,基本上就是華為無情工商,講者也知道有點偏題,我沒有聽完我就走了,也有很多人陸續跑掉。

第一天大概就這樣結束了,經過Exhibition時發現還沒開始,還在場佈,所以沒法逛

感謝你的閱讀,如果你對我的文章對你有所幫助或是意見歡迎回覆,如果你想要支持我可以:

或是觀看我其他系列文章


메타데이터
post_id
b2c917432f7a
slug
工作-siggraph-asia-2024-day-1-b2c917432f7a
url
https://medium.com/maochinn/%E5%B7%A5%E4%BD%9C-siggraph-asia-2024-day-1-b2c917432f7a
canonical_url
https://medium.com/maochinn/%E5%B7%A5%E4%BD%9C-siggraph-asia-2024-day-1-b2c917432f7a
author_url
https://medium.com/@maochinn
status
ok
fetched_at
2026-07-30 08:08:36