LLMS.txt ile Yeni Bir Standart Mı Oluşuyor?
Klasik SEO dünyasında robots.txt ve sitemap uzun süredir “arama motorlarıyla konuşmanın” temel dilidir. Bir site sahibi olarak bunları…
LLMS.txt ile Yeni Bir Standart Mı Oluşuyor?
Klasik SEO dünyasında robots.txt ve sitemap uzun süredir “arama motorlarıyla konuşmanın” temel dilidir. Bir site sahibi olarak bunları doğru tuttuğunuzda Google gibi sistemler sayfaları keşfedebilir, indeksleyebilir ve sıralamaya sokabilir. Peki aynı siteyi bugün sohbet arayüzleri, cevap motorları ve asistanlar nasıl “görüyor”? Orada kural kitabı hâlâ yazılıyor; ama ihtiyaç duyulan sinyaller farklılaşıyor.
Bu yazıda, tek bir ZIP veya bir klasör içinde toplanan şu dosya türlerinin — llms.txt, llms-full.json, knowledge-graph.json, tools.json, agents.json, rag-config.json, ai-manifest.json, crawler-signals.json, citation-policy.json, authority-signals.json — neden ortaya çıktığını, sitemap + robots ile neden yetinemediğimizi ve yapay zekâ arama / cevap optimizasyonu bağlamında ne vaat edip ne vaat etmediğini anlatmaya çalışıyorum. Repo veya araç tanıtımı değil; daha çok “bu dosya isimleri neden anlamlı?” sorusuna uzun bir cevap.

robots.txt ve sitemaps.xml ne işe yarıyor, ne işe yaramıyor?
Robots.txt büyük ölçüde şunu söyler: “Hangi botlar hangi yollara girebilir?” — yani erişim politikası. Sitemaps ise şunu söyler: “İşte önemli veya güncel sayfalarımın listesi” — yani keşif ve envanter. İkisi birlikte, geleneksel web araması için çok değerli.
Ama bir LLM veya RAG hattı için soru şu: Bu sitenin içeriğini hangi sırayla, hangi bağlamda, hangi parçalara bölerek, hangi araçlarla ve hangi atıf kurallarıyla kullanmalıyım? Sitemaps bir URL listesidir; sayfa başlığı meta verisi, JSON-LD, formlar, iç link grafiği, önerilen chunk boyutu, atıf formatı gibi şeyleri taşımaz. Robots.txt de “siteyi nasıl özetleyeceğim” veya “hangi dosyayı önce okuyacağım” sorusuna cevap vermez.
Kısaca: Keşif ≠ anlamlandırma ≠ güvenli yeniden kullanım ≠ öneri için marka sinyali. Bu yüzden sadece iki dosyayla “LLM dünyasına hazırım” demek mümkün değil; en azından ek bir katman gerekir. İşte paket dosyaları bu katmanı denemek için bir dil.
Paket içindeki dosyalar neyi temsil ediyor?
Aşağıdaki ayrım yapay: İnsan okur, makine okur, pipeline okur.
llms.txt
Genelde kısa, üst seviye bir rehber — “bu siteyi model veya asistan için nasıl okuyalım?” özetini taşır. llms.txt kültürü, web sitelerinin kökünde veya belirli bir yolda bu tür bir dosyayı sunma fikrine dayanıyor. İnsan veya sistem, “buradan başla” diye bir harita görür.
llms-full.json
Sitemap URL’lerini sayfa düzeyinde zenginleştirir: başlık, özet, metin önizlemesi, yapılandırılmış veri parçaları. Yani “hangi URL var” değil, “o URL’de ne var” sorusuna yaklaşır. RAG için ham madde buraya yakın durur.
knowledge-graph.json
Sayfaları ve ilişkileri düğüm ve kenar olarak düşünür: iç linkler, dış linkler, site kökü. Bu, “tek tek sayfa”dan öte bağlantısal bir görünüm sunar; çoklu atlama, genişletme, özetleme senaryolarında işe yarar.
tools.json
Formların action alanları, /api/ benzeri sezgisel yollar gibi eylem ve entegrasyon ipuçları. Sitemap “şu sayfa var” der; araç dosyası “şu sayfa bir şey yapmaya çalışıyor olabilir” der — otomasyon veya öneri sistemleri için.
agents.json
İnsan değil, otomasyon veya görev akışı düşünüldüğünde: hangi tür işlemler anlamlı olabilir (özetleme, form doldurma önerisi vb.). Bu kısım daha çok “ajan” metaforuyla konuşan sistemlere seslenir.
rag-config.json
Metni parçalara bölerken hedef token, overlap, dil, hibrit retrieval gibi varsayılanlar. Sitemap’in hiçbir yerinde “chunk boyutu 512” yazmaz; bu dosya pipeline’ın ayarını sözlü hale getirir.
ai-manifest.json
Paketin içindekiler tablosu ve “önce şunu oku” sırası. Makine için bir manifest; insan için de bir harita.
crawler-signals.json
Sitemap’lerin nereden bulunduğu, strateji, ipuçları — yeniden tarama veya güncelleme düşünüldüğünde işe yarar. “Bu paket hangi keşifle üretildi?” sorusuna cevap verir.
citation-policy.json
Model veya uygulama nasıl atıf yapmalı — başlık mı, URL mi, erişim tarihi mi? Bu, telif ve güven için önemli; sitemap’te yoktur.
authority-signals.json
GitHub yıldızı gibi dışarıdan gelen otorite sinyalleri için yer tutucu. Gerçek dünyada backlink ölçümü ayrı API’ler ister; bu dosya “dürüstçe bilinmiyor veya şu kaynaktan şu kadar” demek için kullanılabilir.
Neden tek başına sitemaps yetmiyor?
Özetleyeyim:

Yapay zekâya “Neden benim sitemi önermiyorsun diye?” sorduğumda
Bu sorunun cevabı tek bir dosyada gizli değil. Birkaç katman var diye yanıt verdi İşte o katmanlar:
- Eğitim verisi ve popülerlik — Modeller geniş web’ten öğrenir; dar kitleli veya yeni bir site, “genel öneri” listelerinde görünmeyebilir.
- Tazelik ve güven — Cevap motorları güncel bilgiyi tercih eder; sitenizin güncelliği, güvenilir kaynaklardan bahsedilmesi, haberlerde görünmesi ayrı konular.
- Yapılandırılmış sinyal eksikliği — Schema.org, net başlıklar, tutarlı iç link, açık kaynak politikası gibi şeyler hem klasik hem AI aramasında yardımcı olur; ama garanti değil.
- Tüketim kanalı — Bazı asistanlar canlı web’i taramıyor; sadece indekslenmiş veya önceden seçilmiş kaynaklara bakıyor.
llms.txtveya paket dosyaları o kanalın sizi okuduğu bir yerde duruyorsa anlamlıdır; yoksa tek başına “öner beni” demez. - Marka ve niyet — Kullanıcı “en iyi X aracı” diye sorduğunda model, bilinen markaları öne çıkarır. Bu, dosya eklemekle bir gecede değişen bir şey değil.
Bu dosyalar ne kadar “bizi önermeyi” sağlar? Dürüst cevap: Doğrudan sıralama garantisi vermezler.
Ama şunları yapabilirler:
- Sitenizi LLM’lere veya RAG pipeline’larına açık, yapılandırılmış ve tekrarlanabilir biçimde sunar.
- Atıf ve kullanım kurallarını netleştirir (özellikle
citation-policyve manifest). - İçeriğinizi bilgi grafiği ve araç olarak düşünen sistemlere daha iyi “elle tutulur” veri verir.
Yani “AI önerisi” ile “LLM ingestion’da kullanılabilir paket” farklı hedefler; bu dosyalar ikincisine yakın, birincisine dolaylı katkı sunar.
Şu an ne oluyor? (AI arama ve cevap dünyası)
- Geleneksel arama hâlâ link listesi üretiyor; ama AI özetleri ve sohbet arayüzleri giderek cevabın kendisini öne çıkarıyor.
- Bing / ChatGPT, Perplexity, Google AI Overviews gibi ürünlerde kaynak gösterme, alıntı ve güncellik farklı kurallarla işliyor.
- llms.txt ve benzeri girişimler, sitelerin “model için kısa harita” sunmasını teşvik ediyor; henüz her platformda zorunlu standart değil.
Bu yüzden “AI SEO” veya AEO (answer engine optimization) gibi etiketler konuşuluyor: içerik sadece anahtar kelimeye değil, soru cevaplama, net başlık, güvenilir kaynak gösterme ve makine tarafından işlenebilir özete de uygun olmalı.
Gelecekte neler olabilir?
- Doğrulanmış kaynaklar ve yayıncı kimliği ile bağlantılı özetler.
- Daha fazla standart:
llms.txtbenzeri dosyaların yanında, atıf, lisans ve güncellik için ortak şemalar. - Kurumsal RAG tarafında: sitelerin kendi paketlerini periyodik üretip müşterilere veya indeksleyicilere vermesi.
- Etik ve hukuk: tarama, özetleme, yeniden yayınlama için net politikalar —
citation-policyve manifest bu yüzden önem kazanabilir.
Sonuç
Robots.txt ve sitemaps.xml, web’in “botlarla konuşma” dilinin temelidir; LLM ve RAG dünyası ise “içeriği nasıl parçalayıp, nasıl ilişkilendirip, nasıl atfedip, hangi pipeline’da nasıl kullanacağım?” diye sorar. Bu ikinci soru için ayrı bir paket dili denemek gerekiyor; listelediğim dosya adları da bu dilin parçaları.
Bu dosyalar sizi tek başına “yapay zekânın favori sitesi” yapmaz; ama içeriğinizi ölçülebilir, paylaşılabilir ve makine tarafından okunabilir kılar. Öneri motorları ve asistanlar için ise uzun vadede görünürlük ve güven inşasının parçası olabilir — özellikle de siteniz gerçekten cevapladığı sorulara net ve güncel cevaplar veriyorsa.
Bu metin kavramsal bir çerçeve sunar; örnek bir paket ürettim ve bu bahsettiğim dosyaları oluşturan basit bir tool olarak çalışıyor [awesome-llms-webtools](https://github.com/halituzan/awesome-llms-webtools) reposunu inceleyerek ve forklayarak destek olabilirsiniz. Okuduğunuz için teşekkürler.
메타데이터
- post_id
- fc2cdf902ac1
- slug
- sitemaps-xml-ve-robots-txt-fc2cdf902ac1
- url
- https://medium.com/@halituzan/sitemaps-xml-ve-robots-txt-fc2cdf902ac1
- canonical_url
- https://medium.com/@halituzan/sitemaps-xml-ve-robots-txt-fc2cdf902ac1
- author_url
- https://medium.com/@halituzan
- status
- ok
- fetched_at
- 2026-08-17 17:22:44