CANLI · 1087 haber akışta Son güncelleme 11:57
19 Eylül 2026
AI · Hugging Face Blog

Açık Modellerin Aracıcılık Sınavı: Hugging Face’in Kendi Araçlarınızla Test Metodu

Açık kaynaklı modellerin kendi araç setinizde ne kadar ajan davranabildiğini ölçen bir test yöntemi sunuyor: doğru cevap yetmiyor, süreç de sayılıyor.

18 Haziran 2026

Ne oldu?


Hugging Face, “Is it agentic enough?” başlıklı yeni bir çalışmayla açık kaynaklı modellerin kendi araç setlerinizde — örnek vaka olarak `transformers` kütüphanesi kullanılarak — ne kadar aracıcı olduğunu ölçen bir yöntem ve açık kaynak `agent-eval` aracını tanıttı. Geleneksel kıyaslamalar yalnızca sonucun doğru olup olmadığına bakarken, bu yaklaşım modelin doğru yanıta ulaşmak için harcadığı çabayı da kaydediyor: kaç tur, kaç token, kaç saniye, kaç hata ve izlenen yol. `pi` kodlama ajanı ile Hugging Face Jobs altyapısında çalışan sistem, farklı model ve kütüphane revizyonlarını aynı görevlerde karşılaştırarak aracın gerçekten ajan dostu olup olmadığını gösteriyor.

Neden önemli?


Büyük açık modeller, sıradan görevlerde neredeyse yüzde yüz doğru yanıt verebiliyor; bu yüzden yalnızca “doğru cevap” metriği, bir kütüphanenin veya API’nin ajanlar için ne kadar kullanışlı olduğunu anlatmıyor. Önemli olan, ajanın işlemi ne kadar emekle tamamladığı: CLI komutlarına mı yöneliyor, kaynak kodu klonlayıp kendi başına mı yazıyor, belgeleri ve örnekleri etkin kullanabiliyor mu? transformers üzerindeki örnek çalışma, kütüphaneye özel CLI ve Skill — yani seçilmiş doküman ve örnekler — eklenmesinin büyük modellerde tamamlama süresini kısalttığını, ancak küçük modellerin yeni bağlama takılıp başarısız olabildiğini gösterdi. Bu, “herkes için tek bir iyileştirme” yaklaşımının farklı model boyutlarında farklı etkiler doğurduğunu ortaya koyuyor.

Ayrıca bu yöntem, genel bilgi sınavlarında yüksek puan alan modellerin özel, gerçek dünya araçlarınızda büyük performans düşüşü yaşayabileceği uçurumu görünür kılıyor. Açık modellerin kendi kod tabanınızda, kendi API’nizde ve kendi dokümanlarınızda test edilmesi, liderlik tablolarından daha gerçekçi bir öngörü sunuyor.

Kim veya ne etkileniyor?


Doğrudan etkilenenler, açık kaynaklı modelleri ürünlerine veya iç araçlarına entegre eden yazılım ekipleri, kütüphane geliştiricileri ve API ya da araç sahipleri. transformers, smolagents ve benzeri ekosistemleri yönetenler, ajan optimize dokümantasyon, CLI ve örnek setleri (Skill) hazırlamak durumunda kalacak. Bulut sağlayıcıları ve kendi model sunumlarını yapan şirketler için de, müşterilerin gerçek iş akışlarında hangi modelin daha az hata ve daha düşük token maliyetiyle çalıştığı seçim kriterlerini değiştirecek. Son kullanıcılar ise dolaylı olarak daha güvenilir, daha hızlı ve daha az pahalı ajan deneyimleri kazanacak.

Ne yapılmalı?


Ekipler, ajan entegrasyonuna geçmeden önce kendi araç ve kütüphanelerini bu tür bir harness ile kendi modelleriyle test etmeli. API’leri keşfedilebilir, dokümantasyonu yapılandırılmış ve kısa çalışan örneklerle desteklenmiş hale getirilmeli; mümkünse CLI ve Skill tabanlı yardımcılar sunulmalı. Aynı görev farklı model büyüklüklerinde ve kütüphane revizyonlarında çalıştırılarak, büyük modeller için hız kazanımlarının küçük modellerde başarısızlığa dönüşmediği doğrulanmalı. Sonuçları statik HTML rapor olarak yayınlamak ve sürekli izlemek, ajan deneyimini ölçülebilir bir kalite metriğine dönüştürüyor. Kaynaklar: Hugging Face blogu, agent-eval deposu, Hugging Face Jobs.

Kaynaklar

Güne dön