CANLI · 1087 haber akışta Son güncelleme 11:57
19 Eylül 2026
AI · Hugging Face Blog

Yapay Zekada Test Karmaşası Son Buluyor: Hugging Face ve Every Eval Ever Güçlerini Birleştirdi

Hugging Face, Every Eval Ever entegrasyonuyla yapay zeka model değerlendirmelerini standartlaştırıyor. Artık tüm performans skorları doğrulanabilir olacak.

30 Haziran 2026

Ne oldu?

Hugging Face, yapay zeka modellerinin değerlendirme sonuçlarını daha şeffaf ve standart bir hale getirmek amacıyla Every Eval Ever (EEE) ve Hugging Face Community Evals platformları arasında tam uyumluluk sağlayan yeni bir entegrasyonu duyurdu. Şubat 2026'da EvalEval Koalisyonu tarafından başlatılan EEE ile Hugging Face'in yine aynı dönemde kullanıma sunduğu Community Evals, bu birleşmeyle birlikte modellerin performans testlerini tek bir çatı altında topluyor. Geliştiriciler artık dönüştürücü bir araç yardımıyla EEE formatındaki JSON verilerini Hugging Face'in beklediği YAML dosyalarına dönüştürerek model sayfalarında doğrudan yayınlayabilecek. Model kartlarında yer alacak bu değerlendirme skorları, doğrudan EvalEval üzerindeki detaylı ve doğrulanabilir kaynak kaydına bağlantı verecek.

Neden önemli?

Bu entegrasyon, yapay zeka sektöründe uzun süredir ciddi bir sorun olan "değerlendirme tutarsızlığı" krizine doğrudan çözüm üretiyor. Günümüzde aynı yapay zeka modelinin (örneğin LLaMA-65B) aynı benchmark testinde (MMLU gibi) test ayarlarına bağlı olarak %63,7 ile %48,8 gibi son derece farklı skorlar elde ettiği görülüyor. EEE'nin sunduğu standart veri şeması; testi kimin çalıştırdığı, modele nasıl erişildiği, üretim ayarları ve metrik tanımları gibi kritik parametreleri zorunlu kılarak bu sapmaları önlüyor. Bu sayede test sonuçları sadece birer skordan ibaret kalmayıp, tamamen yeniden üretilebilir ve doğrulanabilir bilimsel kayıtlara dönüşüyor.

Ayrıca, yapay zeka modellerini test etmek oldukça yüksek maliyetler gerektiriyor. EEE veri deposunda (datastore) şu an 22 binden fazla model ve 2.200'den fazla benchmark'ı kapsayan 229 binden fazla test sonucu birikmiş durumda. Bu testlerin sıfırdan yapılması yüz binlerce dolarlık bir hesaplama bütçesi gerektireceğinden, bu verilerin standartlaştırılarak korunması ve kolayca erişilebilir kılınması sektöre devasa bir kaynak tasarrufu sağlıyor. Hugging Face'in entegrasyonu, geliştiricilerin en güncel performans verilerine doğrudan model sayfalarından ulaşmalarını sağlayarak karşılaştırma süreçlerini kökten kolaylaştırıyor.

Kim veya ne etkileniyor?

Bu değişimden ilk elden yapay zeka araştırmacıları, açık kaynaklı model geliştiricileri, teknoloji şirketleri ve yapay zeka politikası yapıcıları etkileniyor. MMLU-Pro, GPQA, HLE (Humanity's Last Exam) ve GSM8K gibi popüler benchmark'ları kullanan tüm sistemler ve bu sistemlerin performansını ölçen bağımsız test ekipleri entegrasyonun doğrudan parçası haline geliyor. Özellikle kurumsal seviyede model seçimi yapmaya çalışan şirketler ve güvenlik politikalarını denetlemek isteyen regülatörler, artık doğrulanmamış veya yanlı raporlanmış skorlar yerine, Hugging Face üzerinde "doğrulanmış kaynak" işareti taşıyan güvenilir verilere dayanarak karar verebilecekler.

Ne yapılmalı?

Geliştiriciler ve araştırmacılar, ürettikleri yapay zeka modellerinin performans skorlarını paylaşırken her iki platformu da aktif şekilde kullanmalıdır. EvalEval'ın sunduğu açık kaynaklı dönüştürücü aracını (`community_evals_converter.py`) kullanarak mevcut Every Eval Ever test sonuçlarını Hugging Face formatına aktarmak ve model sayfalarındaki `.eval_results/` klasörüne eklemek atılması gereken en pratik adımdır. Bu sayede hem modellerin şeffaflığı ve güvenilirliği artırılacak hem de yapay zeka topluluğunun performans verilerini bilimsel bir titizlikle doğrulamasına katkı sağlanacaktır.

Kaynaklar

Güne dön