Türk Hukuku için Açık Kaynak RAG Dataset’i
Türkçe legal NLP üzerinde çalışan herkesin bildiği ama açıkça konuşulmayan bir gerçek var: Türk hukuku için herkesin erişebileceği, kaynağı…

Türk Hukuku için Açık Kaynak RAG Dataset’i
Türkçe legal NLP üzerinde çalışan herkesin bildiği ama açıkça konuşulmayan bir gerçek var: Türk hukuku için herkesin erişebileceği, kaynağı doğrulanmış, denetlenebilir bir corpus yok. Var olan birkaç dataset’in büyük çoğunluğu ya kapalı dağıtım yoluyla paylaşılıyor, ya da içeriği şeffaf değil.
Bu boşluğu doldurmak için sıfırdan bir corpus hazırladım ve HuggingFace üzerinde CC BY 4.0 lisansıyla yayınladım. Aşağıda dataset’in içeriği, alınan teknik kararlar, nasıl kullanılacağı ve neden önemli olduğu anlatılıyor.
Dataset linki: https://huggingface.co/datasets/CtnkyaABC/turkish-legal-rag-corpus
Neden Önemli?
Açık ve denetlenebilir. Mevcut Türkçe legal NLP dataset’lerinin önemli bir kısmı sadece kapalı kanallarla dağıtılıyor; üçüncü taraflar inceleyemiyor, atıf yapamıyor, kullanamıyor. Bu dataset HuggingFace üzerinde herkese açık; her satır, her chunk, her metadata alanı görülebiliyor.
Kaynak doğrulanabilir. Her chunk’ın url kolonu mevzuat.gov.tr’deki orijinal PDF’e yönlendiriyor. RAG sisteminizin verdiği cevabı kaynağa kadar takip etmek tek tıkla mümkün; halüsinasyon tespiti kolaylaşıyor.
Sentetik karışım yok. Türkçe legal NLP setlerinin çoğu resmî kanun metnini sentetik soru-cevap çiftleriyle veya LLM tarafından üretilmiş yorum metinleriyle birleştirir. Bu corpus’ta yalnızca resmî kanun maddeleri var; yorum, blog yazısı veya LLM çıktısı karışmamış.
Madde bütünlüğü korunmuş. Türk hukuku kıta Avrupası geleneği içinde kanun-merkezlidir; cevap çoğu zaman bir cümlenin değil, maddenin bütününün anlaşılmasını gerektirir. Bu corpus’ta her chunk bir maddedir; rastgele 512 token pencerelemesi yapılmamıştır.
Yürürlük durumu işaretli. Hukuk metinleri zamanla değişir. Yürürlükten kalkmış (Mülga) maddeler is_active flag’i ile işaretli; güncel hukuk üzerinde değerlendirme yapmak isteyenler tek satırlık filtreyle bunları dışarıda bırakabiliyor.
Kalite metrikleri şeffaf. Her gold soru satırında answer_support_overlap, answer_in_chunk, chunk_strategy, manual_review_reason gibi metrikler tutuluyor. Gizli alan yok; istediğiniz alt-set’i kendi kriterinizle çıkarabilirsiniz.
Dataset İçeriği
Birinci dosya statute_chunks.csv saf mevzuat corpus’u. Toplam 6.350 chunk, 25 ana Türk kanunu, kaynak mevzuat.gov.tr (Cumhurbaşkanlığı Mevzuat Genel Müdürlüğü). Chunk stratejisi madde bazlı, uzun maddeler için kayan pencere. Ortalama chunk uzunluğu 892 karakter. Her satırda kanun adı, kanun numarası, madde numarası, retrieval_text alanı ve orijinal PDF URL’si var.
Kapsadığı kanunlar arasında Türk Medeni Kanunu (1.030 chunk), Türk Ticaret Kanunu (1.545), Türk Borçlar Kanunu (648), Türk Ceza Kanunu (353), Ceza Muhakemesi Kanunu (359), Anayasa (192), Kişisel Verilerin Korunması Kanunu, İş Kanunu, Hukuk Muhakemeleri Kanunu, İdari Yargılama Usulü Kanunu, Tüketicinin Korunması Hakkında Kanun, Bilgi Edinme Hakkı Kanunu ve diğerleri yer alıyor.
İkinci dosya qa_benchmark_gold.csv manuel doğrulanmış altın benchmark. Toplam 290 soru, hepsi manuel doğrulanmış. Aktif kanun (is_active=True) 266 soru, Mülga işaretli (is_active=False) 24 soru. Ortalama answer_support_overlap 0.90. Cümle ortasında başlayan context yok, bot şablonu soru yok, duplicate soru yok.
Nasıl Kullanılır?
Dataset HuggingFace’in standart load_dataset arayüzüyle Python’dan tek satırda yüklenebilir. Hem retrieval corpus’u hem de gold benchmark ayrı config’ler olarak çekilebiliyor. Mülga maddeler is_active flag’i ile filtrelenebilir. FAISS, BGE-M3 ve multilingual-e5 ile uyumlu; retrieval_text kolonu kanun adı ile madde metnini birleştirdiği için cross-law sorularda retrieval doğruluğunu artırır.
Adım adım kod örnekleri, FAISS retrieval şablonu ve benchmark üzerinde Recall@k ölçümü için örnekler HuggingFace dataset sayfasında README altında mevcut:
https://huggingface.co/datasets/CtnkyaABC/turkish-legal-rag-corpus
Kullanım Alanları
Türkçe legal retrieval modeli eğitimi için contrastive fine-tune verisi. RAG sistem benchmark’lama (Recall@k, MRR, EM, F1 metrikleri için manuel doğrulanmış test seti). Hukuki QA modeli eğitimi (extractive QA için doğrudan kullanılabilir). Citation doğruluk testi (her chunk’ta resmî kaynak URL’si). Üniversite NLP ve hukuk-bilişim dersleri için hazır temel dataset. Avukatlık veya danışmanlık prototipleri için CC BY 4.0 lisansıyla ticari kullanım serbest.
Lisans ve Atıf
Bu dataset Creative Commons Attribution 4.0 (CC BY 4.0) lisansıyla yayınlandı. Akademik, eğitim ve ticari her türlü kullanım serbesttir; atıf yapmak yeterlidir. BibTeX formatında atıf bilgisi HuggingFace dataset sayfasında yer alıyor.
Katkı ve Geri Bildirim
Açık kaynak bir projenin değeri kullananların geri bildirimiyle artar. Bug raporu, eklenmesi istenen kanun talebi, pull request veya kendi model skorlarınızı paylaşmak isterseniz HuggingFace Discussions üzerinden iletişime geçebilirsiniz.
Dataset linki: https://huggingface.co/datasets/CtnkyaABC/turkish-legal-rag-corpus
메타데이터
- post_id
- cff2c3bf9312
- slug
- türk-hukuku-için-açık-kaynak-rag-dataseti-cff2c3bf9312
- url
- https://medium.com/@cetinkayaalperenberkee/t%C3%BCrk-hukuku-i%C3%A7in-a%C3%A7%C4%B1k-kaynak-rag-dataseti-cff2c3bf9312
- canonical_url
- https://medium.com/@cetinkayaalperenberkee/t%C3%BCrk-hukuku-i%C3%A7in-a%C3%A7%C4%B1k-kaynak-rag-dataseti-cff2c3bf9312
- author_url
- https://medium.com/@cetinkayaalperenberkee
- status
- ok
- fetched_at
- 2026-06-09 15:37:30