GitHub, README, issue ve pull request’lerden elde edilen 80 milyondan fazla çokdilli sınıflandırma satırını CC0-1.0 ile yayınladı.
Ne oldu?
GitHub, "GitHub Multilingual Repositories Dataset" adını taşıyan yeni bir açık veri setini CC0-1.0 lisansıyla yayınladı. Bu veri seti, 40 milyondan fazla herkese açık depo üzerinde toplam 80 milyondan fazla dil sınıflandırma satırını içeriyor. Her depo için README dosyasının, en çok yorum alan issue’un ve en çok yorum alan pull request’in ilk 150 karakteri dil tanıma modellerine sunulmuş; 20 karakterin altındaki metinler dışarıda bırakılmış. Sınıflandırma işlemi fastText, gcld3 ve lingua-py olmak üzere üç farklı kütüphane ile yapılmış ve yalnızca güven skoru 0,5’in üzerindeki sonuçlar veri setine dahil edilmiş. Ayrıca her kayıt için depo oluşturulma tarihi, disk kullanımı, yıldız ve fork sayıları, birincil programlama dili, SPDX lisansı, issue ve pull request sayıları ile anlık görüntü tarihi gibi zengin metadata da sunuluyor. Veri setindeki dağılım dikkat çekici: örneğin Korece issue metinlerinde en sık görülen İngilizce dışı dil iken, README’lerde Portekizce 3 milyondan fazla depoyla ilk sırada yer alıyor.
Neden önemli?
Günümüzde çoğu büyük dil modeli ve kod asistanı İngilizce merkezli verilerle eğitildiği için İngilizce dışındaki dillerde anlama, üretme ve yardım alma kalitesi düşük kalabiliyor. Geliştirici işbirliği ise yalnızca İngilizce sınırlı değil: README’ler projelerin nasıl çalıştığını açıklıyor, issue’lar yardım isteyenleri bir araya getiriyor, pull request tartışmaları kodun iyileştirilmesine olanak tanıyor. Bu süreçler birçok farklı dilden gelen katılımcı tarafından yürütülüyor. GitHub’ın yeni veri seti, araştırmacıların ve model geliştiricilerin çokdilli geliştirici içeriklerini keşfetmesini kolaylaştırarak düşük kaynaklı dillerdeki veri eksikliğini kapatmaya yardımcı olabilir. Bunun sonucunda kod tamamlama, hata ayıklama, belge üretme ve doğal dil sorguları gibi AI destekli geliştirici araçları İngilizce dışındaki topluluklar için daha güvenilir hale gelebilir.
Aynı zamanda veri seti yalnızca ham metin değil, metadata odaklı bir keşif aracı olarak tasarlandı. Bu sayede kullanıcılar, lisans, programlama dili, popülerlik veya dil sınıflandırması gibi filtrelerle ihtiyaç duydukları alt kümeleri seçebiliyor. Farklı sınıflayıcıların ayrı ayrı sunulması da araştırmacılara hassasiyet ve kapsam arasında kendi denge noktalarını seçme özgürlüğü tanıyor.
Kim veya ne etkileniyor?
Doğrudan etkilenen kesimler arasında doğal dil işleme ve yazılım mühendisliği araştırmacıları, açık kaynak topluluk yöneticileri, kod modelleri geliştiren AI/ML ekipleri ve geliştirici araçları üreten şirketler yer alıyor. Özellikle Korece, Portekizce, Japonca, Çince ve diğer aktif geliştirici topluluklarının dillerinde içerik üreten projeler, AI sistemlerinin daha iyi temsil edilmesi açısından kazançlı çıkabilir. GitHub ve Microsoft açısından ise bu yayın, 2025’te Avrupa Dijital Taahhütleri kapsamında verilen çokdilli verilere erişimi artırma sözünün bir yerine getirilmesi olarak değerlendirilebilir.
Ne yapılmalı?
Araştırmacılar ve model geliştiriciler, bu veri setini çokdilli kod ve doğal dil korpusu oluşturmada bir başlangıç rehberi olarak kullanabilir. Veriyi kullanırken üç sınıflayıcının güven skorlarını karşılaştırmak, yüksek hassasiyet gerektiren çalışmalarda tüm sınıflayıcıların hemfikir olduğu kayıtları seçmek ve daha geniş kapsam isteyenlerde en az birinin yeterli olduğu satırları kullanmak gibi bir strateji izlenmelidir. Veri setinin yalnızca 150 karalık örnekler üzerinden üretildiğini ve kod, rozet, şablon gibi gürültülü metinler içerebileceğini unutmamak gerekir; bu nedenle dil tanıma için nihai bir doğruluk kıstası yerine keşif aracı olarak görülmelidir. Açık kaynak sürdürücüleri, topluluklarının dillerinde daha açık ve yapılandırılmış README/issue yazarak veri kalitesini artırabilir; araç geliştiricileri ise çokdilli bağlamı modellerine entegre ederek küresel kullanıcı deneyimini iyileştirebilir.
Kaynaklar:
- https://github.blog/ai-and-ml/llms/accelerating-researchers-and-developers-building-multilingual-ai-with-a-new-open-dataset/
- https://github.com/github/multilingual-repositories
- https://www.helpnetsecurity.com/2026/06/16/github-multilingual-repositories-dataset-released/