← Back to list

WiDS Taipei 2025 | 數據供應鏈如何決定AI未來:從神經科學研究到AI發展 — 余思潔 Szi-chieh Yu

講者介紹 - Szi-chieh Yu 原為神經科學家,專注於腦連接組的研究。 現在任職於 OpenAI ,在人工數據標註團隊中擔任項目經理。

Anita Ho in Taiwanese in Data Science · 2025-06-29 14:54 · 6 claps · 8.6 min read
#twids #wids #wids2025 #openai
Open on Medium ↗
Wiki topics: LLM · Large Language Models

WiDS Taipei 2025 | 數據供應鏈如何決定AI未來:從神經科學研究到AI發展 — 余思潔 Szi-chieh Yu

講者介紹 – Szi-chieh Yu 任職於 OpenAI ,在人工數據標註團隊中擔任項目經理。 原任職於普林斯頓大學,為神經科學家,專注於腦連接組的研究。 其研究成果曾刊登於 Nature 與 Cell 頂尖期刊,並曾以 12 篇的論文登上 Nature。

  • 本內容完全基於公開資料與資訊,並不代表 OpenAI 現在的專案、計畫與立場,任何提及的技術、方法或組織僅為說明或教育用途。

演講流程:

  1. AI 數據種類與應用
  2. AI 數據來源
  3. 人工數據標註案例
  4. 數據標記流程設計
  5. 標記人員資格
  6. 標記工具與平台
  7. AI 未來趨勢
  8. Q&A

▍1. AI 數據種類與應用

在 AI 的世界裡,資料就像老師或燃料, 多樣化的數據類型推動著不同領域的 AI 應用。

5 個 AI 原始數據種類:

1. 文字數據:自然語言處理(NLP)的基石

  • 聊天機器人 如 Claude, ChatGPT, Gemini,從龐大語言資料庫學習對話能力。
  • 翻譯系統 處理跨語言文本轉換。
  • 搜尋引擎 理解用戶查詢目的,並提供相關結果。

2. 影像數據:電腦視覺的核心,運用大量圖像、影片訓練模型

  • 影像分類 2007年,李飛飛教授為突破 AI 發展瓶頸,有別於以往鑽研演算法,她帶領團隊蒐集並標註大量圖像,建立 ImageNet 資料集。這個龐大資料庫讓AI 訓練有了豐富樣本,推動深度學習技術飛躍發展,掀起全球 AI 熱潮。
  • 醫療診斷 AI 輔助醫師讀取 X 光或 MRI。
  • 生成式 AI 依據文字描述自動生成圖像。

3. 感測器數據:物聯網的神經系統

  • 智慧手機感測器 加速度計、陀螺儀、GPS,記錄使用者的移動狀況。
  • 工業感測器 溫度、壓力數據,拿來做設備預警跟維修排程。
  • 自駕車感測網絡 雷達、光達、鏡頭,幫車子判斷路況。
  • 環境監測 氣象站收集數據,用來預測天氣變化。

4. 行為追蹤數據:運用行為數據,打造個性化服務

  • 網路點擊 追蹤使用者在網站上的瀏覽路徑。
  • 購物紀錄 分析消費者的購物習慣和模式。
  • 社群互動 記錄社群媒體上的互動行為。
  • App 使用軌跡 分析使用者操作 App 的流程。

5. 聲音與語言數據:了解人說話的情緒語調,讓機器讀懂人話的關鍵

  • 語音助理
  • 智慧音箱 Alexa

▍2. AI 數據來源

AI 模型訓練需要各式各樣不同的資料,沒有足夠的數據,模型效果就會大打折扣。目前數據來源主要分為 3 大類:

1. 人類生成的資料(Human-Generated Data)

  • 直接由人類產生或記錄下來的原始資料,為 AI 模型訓練基礎。
  • e.g. 維基百科、論壇、網路上程式碼問答、書籍、研究文章

2. 合成數據(Synthetic Data)

  • 由演算法或模型模擬產生的資料,當真實數據稀少或因隱私性無法直接使用時,就會採用合成數據來補足需求。

3. 人工(標註)數據(Human-Annotated Data)

  • 由專家、標註員對原始資料進行標記。品質非常高,但產生成本高、耗時,不過其品質和準確性對模型效能提升有顯著影響。

▍3. 人工數據標註案例

例子 1:Ground Truthing

  • 所謂 Ground Truthing,就是利用完全正確,且經過人工仔細標註的數據集來訓練 AI 模型。
  • 例如在神經細胞影像分析中,專家會逐一標註每個神經元的位置、形狀與連接方式,建立出資料集。這些高品質的標註數據能讓 AI 學習如何自動辨識神經細胞、追蹤神經元間的連結,進而提升模型的準確度與可靠性。

例子 2:AI數據校正(Proofreading)及神經細胞標記(Cell Annotation)

  • 由於目前 AI 還不夠完美,因此需要大量人工來進行校正。
  • 以 3D 神經細胞圖為例,AI 建構出的細胞模型經常不是一個完整的細胞,會有明顯的跳動或斷點,這時專業人員就必須檢查,找到下一個正確的連接位置,將細胞結構手動連接起來,確保資料的完整性與準確性。

例子 3:自動駕駛數據標註

  • 以 Tesla 為例,自動駕駛系統訓練需要大量標註數據,過去多靠人工逐幀標記車輛、行人等物件,效率低且費時。
  • 為提升速度與準確度,Tesla 開發自動標註系統,運用 Dojo 超級電腦與訓練好的模型,先對影像進行初步標記並建構 3D 場景,把街道上的所有物體分割出來,再由人工進行修正與校正,這樣大幅減少人工標註需求,同時也提升了數據的準確性。

例4:提升模型思維鏈(Chain of Thought)

  • 透過模擬人類解題逐漸標註而成,規定如下:

➊ 每題須包含2–8個解題步驟。

➋ 最終答案為單一整數。

➌ 運算僅限基本四則運算,加減乘除(國小程度數學)。

➍ 解題過程需用自然語言描述步驟,而非純算式。

▍4. 數據標記流程設計

Step 1. 明確了解 AI 訓練需求 釐清訓練用途、目標,以及需要標註的資料類型(如文字、圖像、語音等)。

Step 2. 標註指南與範例提供 明確定義題目與解答要求,或提供範例,讓標註人員有一致的參考標準。

Step 3. 初始資料收集(非必須) 第一次標註的類型,會先進行小規模測試,驗證流程設計與標註品質。

Step 4. 自動生成輔助(非必須) 確認是否需利用模型輔助標註,提高效率。

Step 5. 大規模標註 進行資料批次收集與質量管控,確保標註數據規模與品質。

▍5. 標記人員資格

  1. 學科背景要求多元
  2. 從既有的人才庫,也會透過多元管道積極招募新血
  3. 嚴格的篩選機制
  4. 標註者組成 應具備細心、敏捷與高度領悟力,並重視背景與地域的多樣性,以提升標註品質與資料適用性。

▍6. 標記工具與平台

  • 決定內部或外部平台 可用於任務發布、進度管理與品質監控。
  • 多人同時協作平台 如 Neuroglancer、CAVE。
  • 模型輔助與定制工具(Model in the Loop) 例如 Diffusion 模型輔助分析。
  • 多階段任務安排流程 將複雜流程拆解成簡單步驟。

▍7. AI 未來趨勢

AI 的未來發展高度仰賴人類如何建立與管理資料供應鏈,從多元管道獲取資料、結合神經科學帶來的新技術,到人工標註對模型成長的助益,每個環節都缺一不可,這些都是推動未來 AI 智慧進化的關鍵力量。

▍8. Q&A

問題 1.

Q: 可不可以分享當初是怎麼跨進 AI 領域,並且加入 OpenAI,以及你覺得哪一些能力或者思維是幫助您成功轉換領域的關鍵呢?

A: 其實我一開始並沒有特別打算要轉入 AI 領域,契機是在參與一個神經科學相關計畫的過程中,慢慢接觸到的。因為我本身有生物背景,過去也有操作電子顯微鏡的經驗,專門負責拍攝細胞影像。剛好那段時間加入了普林斯頓大學的實驗室,開啟了我在神經科學與 AI 整合方面的經歷。

我自己也沒有電腦科學(CS)背景,所以我能理解跨領域轉換的不容易。不過,如果你現在有興趣進入 AI 領域,可以思考是否能以你原本的專業為基礎,找到與 AI 結合的切入點。從應用角度出發,看看哪些領域與 AI 有交集的機會。

此外,雖然不一定要非常精通程式設計,但對於寫程式或基本的邏輯還是要有一定的理解。因為懂一點程式邏輯,會讓你更容易寫出有效的提示(prompt),也更好與 AI 協作。其實 AI 就像是一個很好的幫手,如果你 prompt 下得好,它可以幫你完成很多事,所以不用太擔心不會寫程式這件事。

問題 2.

Q: 在做資料自動化標註的時候,如何有效處理大量資料,並排除相似資料?尤其是在 AI 團隊常見的資料處理任務中,如何使用模型自動化處理、提升效率?

A: 自動化資料標註的最大優勢,就是能夠快速大量處理重複性的工作。當標註的任務很明確時(例如車子、腳踏車等),我們可以先訓練一個模型,接著讓它自動對大批資料進行標註,這在處理成千上萬筆資料時特別有效率。

針對如何排除相似資料這部分,可以透過以下方式:

  1. Embedding 方法判斷相似度:

我們會將資料轉換成向量(例如使用 word embedding),並計算資料之間的相似度。

  1. 設定相似度門檻(threshold):

當兩筆資料的相似度超過某個門檻值,我們就可以自動判定它們太相似,從資料集中排除。

  1. 人工與模型結合判斷:

初期會搭配人工標記來建立標準,之後模型可以根據這個標準自動分類、篩選資料。

問題 3.

Q: 剛剛有提到合成數據(Synthetic Data)是模型生成的,那會不會導致模型只是在學習其他模型的結果,而不是學習真實世界的資料?這樣不就失去意義了嗎?

A: 這個疑問真的很多人都有,完全可以理解。所謂的 synthetic data,也就是合成數據,它確實是模型自己產生出來的。那這當然就會讓人擔心說,這個模型是不是只是在學另外一個模型的東西?這樣學出來的結果會不會離現實世界太遠?

其實合成數據這件事情,現在已經變成一門專門的學問了。怎麼讓模型生成出來的數據是有用的,本身就很有挑戰,而最大的挑戰就是多樣性。我們不希望模型只是生成一堆類似的東西,而是真的能覆蓋不同情境、不同類型的資料。

所以才會說,訓練一個大模型的時候,數據來源一定不能單一。你需要有從網路上來的真實資料,然後搭配模型生成的合成數據,最後再補上人類標註的資料。這三種來源互相搭配,才能讓模型更完整。

所以總結來說,雖然合成數據是模型產生的沒錯,但它的角色不是取代,而是補足真實資料不足的部分,只要設計得好,其實它是很重要的一塊拼圖喔。


메타데이터
post_id
d6ec06adc78d
slug
wids-taipei-2025-how-the-data-supply-chain-determines-the-future-of-ai-by-szi-chieh-yu-d6ec06adc78d
url
https://medium.com/women-in-data-science-taipei/wids-taipei-2025-how-the-data-supply-chain-determines-the-future-of-ai-by-szi-chieh-yu-d6ec06adc78d
canonical_url
https://medium.com/women-in-data-science-taipei/wids-taipei-2025-how-the-data-supply-chain-determines-the-future-of-ai-by-szi-chieh-yu-d6ec06adc78d
author_url
https://medium.com/@nitaho134
status
ok
fetched_at
2026-06-15 20:49:13