จัดอันดับโมเดล Text Embedding ภาษาไทย 2026 — Thai MTEB Leaderboard…
ถ้าคุณเคยทำ RAG, semantic search, หรือระบบค้นหาภาษาไทยแล้วต้องเลือกโมเดล embedding สักตัว คุณน่าจะเจอปัญหาเดียวกับเรา: ไม่มีใครรู้จริง ๆ…
จัดอันดับโมเดล Text Embedding ภาษาไทย 2026 — Thai MTEB Leaderboard ตัวแรกที่รันบนซูเปอร์คอมพิวเตอร์ไทย
ถ้าคุณเคยทำ RAG, semantic search, หรือระบบค้นหาภาษาไทยแล้วต้องเลือกโมเดล embedding สักตัว คุณน่าจะเจอปัญหาเดียวกับเรา: ไม่มีใครรู้จริง ๆ ว่าตัวไหนเก่งภาษาไทย
ทุกเจ้าก็เคลม “multilingual” “รองรับ 100+ ภาษา” กันหมด แต่พอเอามาใช้กับข้อความไทยจริง ๆ บางตัวก็เหมือนไม่เคยเห็นภาษาไทยมาก่อนเลยด้วยซ้ำ ส่วน leaderboard ระดับโลกอย่าง MTEB ก็เน้นอังกฤษ/จีนเป็นหลัก ภาษาไทยแทบไม่มีที่ยืน
เลยเป็นที่มาของโปรเจกต์นี้ — Thai MTEB Leaderboard จัดอันดับโมเดล embedding บนงานภาษาไทยจริง 28 งาน รันบน LANTA ซูเปอร์คอมพิวเตอร์แห่งชาติของไทย
👉 ดูตัวเต็มได้ที่: **https://anusoft.github.io/thai-mteb-leaderboard/**
วัดอะไรบ้าง?
เราเอาโมเดลมารันบน benchmark 28 งาน ครอบคลุม 6 ประเภทงานที่คนใช้กันจริงในงานภาษาไทย:
- Retrieval (9 งาน) — หาเอกสารที่ตรงกับคำถาม หัวใจของ RAG เลย (XQuAD, MIRACL, Belebele, MrTidy ฯลฯ)
- Classification (9 งาน) — แยกประเภทข้อความ เช่น วิเคราะห์ความรู้สึก (Wisesight, Wongnai), แยก intent
- Bitext Mining (6 งาน) — จับคู่ประโยคไทย-อังกฤษที่ความหมายตรงกัน
- Reranking (2 งาน) — จัดอันดับเอกสารตามความเกี่ยวข้อง
- Clustering (1 งาน) — จัดกลุ่มเนื้อหาที่คล้ายกันเอง
- Pair Classification (1 งาน) — ดูความสัมพันธ์ระหว่างประโยค (NLI)
คะแนนที่เห็นคือค่าเฉลี่ยรวมทุกงาน (ยิ่งสูงยิ่งดี)
อันดับ Top 10 🏆
อันดับโมเดลคะแนนเฉลี่ยงานที่รันได้
┌───────┬───────────────────────────────────────┬─────────────┬──────────────┐ │ อันดับ │ โมเดล │ คะแนนเฉลี่ย │ งานที่รันได้ │ ├───────┼───────────────────────────────────────┼─────────────┼──────────────┤ │ 🥇 1 │ Qwen/Qwen3-Embedding-4B │ 74.41 │ 24/28 │ │ 🥈 2 │ tencent/KaLM-Embedding-Gemma3–12B │ 73.92 │ 28/28 │ │ 🥉 3 │ ICT-TIME-and-Querit/BOOM_4B_v1 │ 71.84 │ 19/28 │ │ 4 │ Linq-AI-Research/Linq-Embed-Mistral │ 69.43 │ 3/28 │ │ 5 │ jinaai/jina-embeddings-v5-text-small │ 68.30 │ 28/28 │ │ 6 │ Qwen/Qwen3-Embedding-0.6B │ 67.73 │ 28/28 │ │ 7 │ google/embeddinggemma-300m │ 67.53 │ 28/28 │ │ 8 │ intfloat/multilingual-e5-large-instr. │ 67.22 │ 28/28 │ │ 9 │ Octen/Octen-Embedding-8B │ 67.02 │ 3/28 │ │ 10 │ jinaai/jina-embeddings-v5-text-nano │ 66.85 │ 28/28 │ └───────┴───────────────────────────────────────┴─────────────┴──────────────┘
- บางตัวรันได้แค่ 3 งาน (ผ่านรอบ screening แต่ติดข้อจำกัด memory ตอนรันเต็ม) คะแนนเลยเทียบตรง ๆ กับตัวที่รันครบ 28 งานไม่ได้ 100% ดูแบบ apples-to-apples ให้โฟกัสตัวที่ขึ้น 28/28
ของน่าสนใจที่เจอ
1. Qwen3-Embedding ครองตลาด ทั้งตัว 4B และตัวจิ๋ว 0.6B ติด Top 6 ทั้งคู่ ที่เด็ดคือเจ้า 0.6B ตัวเล็กนิดเดียวแต่ได้ 67.73 เอาชนะโมเดลที่ใหญ่กว่าหลายเท่าได้สบาย ถ้าอยากได้คุ้มราคา/รันบนเครื่องไม่แรง ตัวนี้น่าจับตา
2. ตัวเล็กไม่ได้แปลว่าแย่ google/embeddinggemma-300m แค่ 300M พารามิเตอร์ แต่ขึ้นอันดับ 7 ได้คะแนน 67.53 รันครบ 28 งาน — เด่นมากเรื่อง classification ภาษาไทย (71.67) นี่คือตัวเลือกที่ดีถ้าต้องการ deploy บนเครื่องเล็กหรือบน edge
3. KaLM-Gemma3–12B แชมป์ตัวรันครบ ถ้านับเฉพาะโมเดลที่รันครบทั้ง 28 งานแบบไม่มีข้อแม้ ตัวนี้คือเบอร์หนึ่ง (73.92) เก่งรอบด้านโดยเฉพาะ Bitext Mining (93.31) แต่แลกมาด้วยขนาด 12B ที่กินทรัพยากรหนัก
4. bge-m3 ที่หลายคนใช้กันอยู่… อยู่กลางตาราง BAAI/bge-m3 ที่เป็นขวัญใจคนทำ RAG ภาษาไทยมานาน ได้ 64.77 (อันดับ 14) — ยังโอเคอยู่ และเด่นเรื่อง Reranking (63.24) กับ Retrieval (69.67) แต่ตอนนี้มีตัวเลือกใหม่ ๆ ที่ทำคะแนนรวมดีกว่าแล้วนะ
5. โมเดลฝรั่งบางตัวสอบตก มีหลายโมเดลที่เคลมว่า multilingual แต่พอเจอภาษาไทยจริงคะแนนตกฮวบ — รอบ screening เราเทสต์ไป 39 ตัว ผ่านแค่ 19 ตัวที่ “พูดไทยได้จริง” (เกณฑ์คะแนนเฉลี่ย >50) ที่เหลือต่ำกว่า 20 คือแทบไม่เคยเทรนด้วยข้อมูลไทยเลย
วิธีคัดกรอง (Screening)
โมเดล embedding บนโลกมีเป็นพัน ๆ ตัว เรารันครบทุกตัวไม่ไหว เลยใช้วิธี 2 สเตป:
- รอบคัดกรอง — เอา 39 ตัวมารัน 3 งานเร็ว ๆ (ใช้เวลา ~2–5 นาที/งาน บน A100):
WisesightSentiment— sentiment โซเชียลไทยแท้ ๆSIB200— แยกหัวข้อXQuAD— อ่านจับใจความภาษาไทย
ตัวไหนได้เฉลี่ย >50 = ผ่านเข้ารอบ, ตัวไหน <20 = ตัดทิ้ง (ไม่มีข้อมูลเทรนภาษาไทย)
รอบเต็ม — ตัวที่ผ่านเอามารันครบ 28 งาน
รันบนอะไร?
ทั้งหมดนี้รันบน LANTA ซูเปอร์คอมพิวเตอร์ Cray EX ของไทย ใช้ GPU NVIDIA A100-SXM4–40GB โดยได้ทรัพยากรการคำนวณฟรีจาก ThaiSC / NSTDA ต้องขอบคุณมาก ๆ ถ้าไม่มีตรงนี้โปรเจกต์นี้คงไม่เกิด
- Framework: MTEB v2.10.0 + sentence-transformers
- Filter:
languages=["tha"]เอาเฉพาะ subset ภาษาไทยของแต่ละงาน - โมเดลใหญ่ระดับ 7B+ บางตัวชน memory limit ของ A100 40GB เลยรันไม่ครบทุกงาน
ผลทั้งหมดถูกส่งเข้า MTEB Results Repository อย่างเป็นทางการแล้ว (merged เรียบร้อย) ส่วนนิยาม benchmark MTEB(tha, v1) กำลังอยู่ในขั้นตอน review
สรุปสั้น ๆ ว่าควรเลือกตัวไหน
- อยากได้คะแนนสูงสุด ไม่แคร์ขนาด → Qwen3-Embedding-4B หรือ KaLM-Gemma3–12B
- งบจำกัด / เครื่องไม่แรง / อยากได้คุ้ม → Qwen3-Embedding-0.6B หรือ embeddinggemma-300m
- ใช้ bge-m3 อยู่แล้ว → ยังใช้ได้ แต่ลองเทียบกับตัวใหม่ดู อาจอัปเกรดได้
ที่สำคัญ: เลขพวกนี้คือ ค่าเฉลี่ยรวม งานของคุณอาจเน้นแค่ retrieval หรือแค่ classification — แนะนำให้เข้าไปดูคะแนนรายงานแยกตามประเภทงานใน leaderboard แล้วเลือกตัวที่เก่งงานที่คุณใช้จริง
👉 **https://anusoft.github.io/thai-mteb-leaderboard/**
Benchmark นี้เกิดขึ้นได้เพราะทรัพยากรการคำนวณฟรีจาก Thailand Supercomputer Center (ThaiSC) ภายใต้ NSTDA ผ่านระบบ LANTA — ขอบคุณครับ 🙏
메타데이터
- post_id
- a0ba3166e519
- slug
- จัดอันดับโมเดล-text-embedding-ภาษาไทย-2026-thai-mteb-leaderboard-a0ba3166e519
- url
- https://blog.1moby.com/%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5-text-embedding-%E0%B8%A0%E0%B8%B2%E0%B8%A9%E0%B8%B2%E0%B9%84%E0%B8%97%E0%B8%A2-2026-thai-mteb-leaderboard-a0ba3166e519
- canonical_url
- https://blog.1moby.com/%E0%B8%88%E0%B8%B1%E0%B8%94%E0%B8%AD%E0%B8%B1%E0%B8%99%E0%B8%94%E0%B8%B1%E0%B8%9A%E0%B9%82%E0%B8%A1%E0%B9%80%E0%B8%94%E0%B8%A5-text-embedding-%E0%B8%A0%E0%B8%B2%E0%B8%A9%E0%B8%B2%E0%B9%84%E0%B8%97%E0%B8%A2-2026-thai-mteb-leaderboard-a0ba3166e519
- author_url
- https://medium.com/@anusoft
- status
- ok
- fetched_at
- 2026-06-10 08:17:25