← Back to list

จัดอันดับโมเดล Text Embedding ภาษาไทย 2026 — Thai MTEB Leaderboard…

ถ้าคุณเคยทำ RAG, semantic search, หรือระบบค้นหาภาษาไทยแล้วต้องเลือกโมเดล embedding สักตัว คุณน่าจะเจอปัญหาเดียวกับเรา: ไม่มีใครรู้จริง ๆ…

No money, no honey in 1Moby · 2026-06-06 06:48 · 0 claps · 2.0 min read
#embedding #retrieval-augmented #llm
Open on Medium ↗
Wiki topics: LLM · Large Language Models RAG · RAG & Retrieval EVAL · Evaluation & Benchmarks

จัดอันดับโมเดล Text Embedding ภาษาไทย 2026 — Thai MTEB Leaderboard ตัวแรกที่รันบนซูเปอร์คอมพิวเตอร์ไทย

ถ้าคุณเคยทำ RAG, semantic search, หรือระบบค้นหาภาษาไทยแล้วต้องเลือกโมเดล embedding สักตัว คุณน่าจะเจอปัญหาเดียวกับเรา: ไม่มีใครรู้จริง ๆ ว่าตัวไหนเก่งภาษาไทย

ทุกเจ้าก็เคลม “multilingual” “รองรับ 100+ ภาษา” กันหมด แต่พอเอามาใช้กับข้อความไทยจริง ๆ บางตัวก็เหมือนไม่เคยเห็นภาษาไทยมาก่อนเลยด้วยซ้ำ ส่วน leaderboard ระดับโลกอย่าง MTEB ก็เน้นอังกฤษ/จีนเป็นหลัก ภาษาไทยแทบไม่มีที่ยืน

เลยเป็นที่มาของโปรเจกต์นี้ — Thai MTEB Leaderboard จัดอันดับโมเดล embedding บนงานภาษาไทยจริง 28 งาน รันบน LANTA ซูเปอร์คอมพิวเตอร์แห่งชาติของไทย

👉 ดูตัวเต็มได้ที่: **https://anusoft.github.io/thai-mteb-leaderboard/**

วัดอะไรบ้าง?

เราเอาโมเดลมารันบน benchmark 28 งาน ครอบคลุม 6 ประเภทงานที่คนใช้กันจริงในงานภาษาไทย:

  • Retrieval (9 งาน) — หาเอกสารที่ตรงกับคำถาม หัวใจของ RAG เลย (XQuAD, MIRACL, Belebele, MrTidy ฯลฯ)
  • Classification (9 งาน) — แยกประเภทข้อความ เช่น วิเคราะห์ความรู้สึก (Wisesight, Wongnai), แยก intent
  • Bitext Mining (6 งาน) — จับคู่ประโยคไทย-อังกฤษที่ความหมายตรงกัน
  • Reranking (2 งาน) — จัดอันดับเอกสารตามความเกี่ยวข้อง
  • Clustering (1 งาน) — จัดกลุ่มเนื้อหาที่คล้ายกันเอง
  • Pair Classification (1 งาน) — ดูความสัมพันธ์ระหว่างประโยค (NLI)

คะแนนที่เห็นคือค่าเฉลี่ยรวมทุกงาน (ยิ่งสูงยิ่งดี)

อันดับ Top 10 🏆

อันดับโมเดลคะแนนเฉลี่ยงานที่รันได้

┌───────┬───────────────────────────────────────┬─────────────┬──────────────┐ │ อันดับ │ โมเดล │ คะแนนเฉลี่ย │ งานที่รันได้ │ ├───────┼───────────────────────────────────────┼─────────────┼──────────────┤ │ 🥇 1 │ Qwen/Qwen3-Embedding-4B │ 74.41 │ 24/28 │ │ 🥈 2 │ tencent/KaLM-Embedding-Gemma3–12B │ 73.92 │ 28/28 │ │ 🥉 3 │ ICT-TIME-and-Querit/BOOM_4B_v1 │ 71.84 │ 19/28 │ │ 4 │ Linq-AI-Research/Linq-Embed-Mistral │ 69.43 │ 3/28 │ │ 5 │ jinaai/jina-embeddings-v5-text-small │ 68.30 │ 28/28 │ │ 6 │ Qwen/Qwen3-Embedding-0.6B │ 67.73 │ 28/28 │ │ 7 │ google/embeddinggemma-300m │ 67.53 │ 28/28 │ │ 8 │ intfloat/multilingual-e5-large-instr. │ 67.22 │ 28/28 │ │ 9 │ Octen/Octen-Embedding-8B │ 67.02 │ 3/28 │ │ 10 │ jinaai/jina-embeddings-v5-text-nano │ 66.85 │ 28/28 │ └───────┴───────────────────────────────────────┴─────────────┴──────────────┘

  • บางตัวรันได้แค่ 3 งาน (ผ่านรอบ screening แต่ติดข้อจำกัด memory ตอนรันเต็ม) คะแนนเลยเทียบตรง ๆ กับตัวที่รันครบ 28 งานไม่ได้ 100% ดูแบบ apples-to-apples ให้โฟกัสตัวที่ขึ้น 28/28

ของน่าสนใจที่เจอ

1. Qwen3-Embedding ครองตลาด ทั้งตัว 4B และตัวจิ๋ว 0.6B ติด Top 6 ทั้งคู่ ที่เด็ดคือเจ้า 0.6B ตัวเล็กนิดเดียวแต่ได้ 67.73 เอาชนะโมเดลที่ใหญ่กว่าหลายเท่าได้สบาย ถ้าอยากได้คุ้มราคา/รันบนเครื่องไม่แรง ตัวนี้น่าจับตา

2. ตัวเล็กไม่ได้แปลว่าแย่ google/embeddinggemma-300m แค่ 300M พารามิเตอร์ แต่ขึ้นอันดับ 7 ได้คะแนน 67.53 รันครบ 28 งาน — เด่นมากเรื่อง classification ภาษาไทย (71.67) นี่คือตัวเลือกที่ดีถ้าต้องการ deploy บนเครื่องเล็กหรือบน edge

3. KaLM-Gemma3–12B แชมป์ตัวรันครบ ถ้านับเฉพาะโมเดลที่รันครบทั้ง 28 งานแบบไม่มีข้อแม้ ตัวนี้คือเบอร์หนึ่ง (73.92) เก่งรอบด้านโดยเฉพาะ Bitext Mining (93.31) แต่แลกมาด้วยขนาด 12B ที่กินทรัพยากรหนัก

4. bge-m3 ที่หลายคนใช้กันอยู่… อยู่กลางตาราง BAAI/bge-m3 ที่เป็นขวัญใจคนทำ RAG ภาษาไทยมานาน ได้ 64.77 (อันดับ 14) — ยังโอเคอยู่ และเด่นเรื่อง Reranking (63.24) กับ Retrieval (69.67) แต่ตอนนี้มีตัวเลือกใหม่ ๆ ที่ทำคะแนนรวมดีกว่าแล้วนะ

5. โมเดลฝรั่งบางตัวสอบตก มีหลายโมเดลที่เคลมว่า multilingual แต่พอเจอภาษาไทยจริงคะแนนตกฮวบ — รอบ screening เราเทสต์ไป 39 ตัว ผ่านแค่ 19 ตัวที่ “พูดไทยได้จริง” (เกณฑ์คะแนนเฉลี่ย >50) ที่เหลือต่ำกว่า 20 คือแทบไม่เคยเทรนด้วยข้อมูลไทยเลย

วิธีคัดกรอง (Screening)

โมเดล embedding บนโลกมีเป็นพัน ๆ ตัว เรารันครบทุกตัวไม่ไหว เลยใช้วิธี 2 สเตป:

  1. รอบคัดกรอง — เอา 39 ตัวมารัน 3 งานเร็ว ๆ (ใช้เวลา ~2–5 นาที/งาน บน A100):
  • WisesightSentiment — sentiment โซเชียลไทยแท้ ๆ
  • SIB200 — แยกหัวข้อ
  • XQuAD — อ่านจับใจความภาษาไทย

ตัวไหนได้เฉลี่ย >50 = ผ่านเข้ารอบ, ตัวไหน <20 = ตัดทิ้ง (ไม่มีข้อมูลเทรนภาษาไทย)

รอบเต็ม — ตัวที่ผ่านเอามารันครบ 28 งาน

รันบนอะไร?

ทั้งหมดนี้รันบน LANTA ซูเปอร์คอมพิวเตอร์ Cray EX ของไทย ใช้ GPU NVIDIA A100-SXM4–40GB โดยได้ทรัพยากรการคำนวณฟรีจาก ThaiSC / NSTDA ต้องขอบคุณมาก ๆ ถ้าไม่มีตรงนี้โปรเจกต์นี้คงไม่เกิด

  • Framework: MTEB v2.10.0 + sentence-transformers
  • Filter: languages=["tha"] เอาเฉพาะ subset ภาษาไทยของแต่ละงาน
  • โมเดลใหญ่ระดับ 7B+ บางตัวชน memory limit ของ A100 40GB เลยรันไม่ครบทุกงาน

ผลทั้งหมดถูกส่งเข้า MTEB Results Repository อย่างเป็นทางการแล้ว (merged เรียบร้อย) ส่วนนิยาม benchmark MTEB(tha, v1) กำลังอยู่ในขั้นตอน review

สรุปสั้น ๆ ว่าควรเลือกตัวไหน

  • อยากได้คะแนนสูงสุด ไม่แคร์ขนาด → Qwen3-Embedding-4B หรือ KaLM-Gemma3–12B
  • งบจำกัด / เครื่องไม่แรง / อยากได้คุ้ม → Qwen3-Embedding-0.6B หรือ embeddinggemma-300m
  • ใช้ bge-m3 อยู่แล้ว → ยังใช้ได้ แต่ลองเทียบกับตัวใหม่ดู อาจอัปเกรดได้

ที่สำคัญ: เลขพวกนี้คือ ค่าเฉลี่ยรวม งานของคุณอาจเน้นแค่ retrieval หรือแค่ classification — แนะนำให้เข้าไปดูคะแนนรายงานแยกตามประเภทงานใน leaderboard แล้วเลือกตัวที่เก่งงานที่คุณใช้จริง

👉 **https://anusoft.github.io/thai-mteb-leaderboard/**

Benchmark นี้เกิดขึ้นได้เพราะทรัพยากรการคำนวณฟรีจาก Thailand Supercomputer Center (ThaiSC) ภายใต้ NSTDA ผ่านระบบ LANTA — ขอบคุณครับ 🙏


메타데이터
post_id
a0ba3166e519
slug
จัดอันดับโมเดล-text-embedding-ภาษาไทย-2026-thai-mteb-leaderboard-a0ba3166e519
url
https://blog.1moby.com/%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5-text-embedding-%E0%B8%A0%E0%B8%B2%E0%B8%A9%E0%B8%B2%E0%B9%84%E0%B8%97%E0%B8%A2-2026-thai-mteb-leaderboard-a0ba3166e519
canonical_url
https://blog.1moby.com/%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5-text-embedding-%E0%B8%A0%E0%B8%B2%E0%B8%A9%E0%B8%B2%E0%B9%84%E0%B8%97%E0%B8%A2-2026-thai-mteb-leaderboard-a0ba3166e519
author_url
https://medium.com/@anusoft
status
ok
fetched_at
2026-06-10 08:17:25