CANLI · 1087 haber akışta Son güncelleme 11:57
19 Eylül 2026
AI · Hugging Face Blog

Yapay Zekada Yeni Dönem: vLLM Transformers Modelleme Altyapısı Yerel Hız Seviyesine Ulaştı

Hugging Face, vLLM için transformers backend'in yerel hıza ulaştığını duyurdu. Geliştiriciler kod değiştirmeden yüksek çıkarım performansı alacak.

8 Temmuz 2026

Ne oldu?

Hugging Face, vLLM çıkarım (inference) motoru için entegre edilen "transformers" modelleme altyapısının (backend), el yazımıyla optimize edilmiş yerel (native) kod performansına ulaştığını duyurdu. `torch.fx` tabanlı statik grafik analizi ve soyut sözdizimi ağacı (AST) manipülasyonu kullanan bu yeni güncelleme, çalışma zamanında (runtime) katman birleştirme (layer fusion) ve paralelleştirme gibi optimizasyonları dinamik olarak uygulayabiliyor. Geliştiriciler böylece Hugging Face üzerindeki standart bir transformatör modelini herhangi bir kod dönüşümü veya özel optimizasyon portu yazmaya gerek duymadan, vLLM'in yüksek verimli çıkarım gücüyle doğrudan çalıştırabiliyor.

Neden önemli?

Yapay zeka modellerinin yaygınlaşmasıyla birlikte, Hugging Face Transformers kütüphanesi 450'den fazla mimariyle makine öğrenimi için ana referans haline geldi. Ancak en yüksek çıkarım hızına ulaşmak isteyen geliştiriciler, her bir model mimarisi için vLLM üzerinde elle yazılmış özel optimizasyon kodları geliştirmek zorundaydı. Bu durum hem geliştirme sürecini yavaşlatıyor hem de kodun bakımını son derece zorlaştırıyordu. Hugging Face'in yeni entegrasyonu sayesinde, bir model transformers kütüphanesine eklendiği an, vLLM üzerinde de yerel hızında hizmete sunulabilir hale geliyor.

Ayrıca bu entegrasyon, vLLM'in elle yazılmış modellerinin aksine, modellerin eğitim aşamasında da kullanılabilmesini sağlıyor. Yani geliştiriciler eğitim, değerlendirme (evals), pekiştirmeli öğrenme (RL rollouts) ve nihai üretim sunumu süreçlerinin tamamında aynı kod tabanını kullanabiliyor. Qwen3 gibi büyük ölçekli modellerde (tek GPU'lu 4B modellerden, 235B FP8 uzman karışımı (MoE) modellere kadar) yapılan testler, transformers backend'inin yerel vLLM kodunun veri işleme hızını (throughput) yakaladığını, hatta bazı durumlarda geçtiğini gösteriyor.

Kim veya ne etkileniyor?

Bu gelişmeden öncelikle yapay zeka mühendisleri, LLM (Büyük Dil Modelleri) ve VLM (Görsel Dil Modelleri) entegrasyonu yapan şirketler ve açık kaynaklı model geliştiricileri etkileniyor. Artık model geliştiricilerinin vLLM için ayrı bir optimizasyon kodu yazma yükümlülüğü ortadan kalkıyor. Altyapı olarak ise tekli GPU kurulumlarından, tensor paralelliği kullanan çoklu GPU kümelenmelerine ve uzman paralelliğine (expert parallelism) sahip karmaşık MoE sistemlerine kadar geniş bir yelpaze bu performanstan doğrudan yararlanıyor. Ancak doğrusal dikkat (linear attention) kullanan modeller ve Hub depolarındaki uyumsuz özel modeller şu an için desteklenmiyor.

Ne yapılmalı?

Yapay zeka modellerini yayına alan geliştiricilerin vLLM kütüphanelerini en son sürüme güncellemeleri ve modellerini sunarken komut satırına `--model-impl transformers` parametresini eklemeleri öneriliyor. Bu basit parametre geçişi, karmaşık kod tabanlarını sadeleştirirken donanım kaynaklarının daha verimli kullanılmasını sağlayacak ve sunucu maliyetlerini düşürecektir. Doğrusal dikkat kullanan modellerin desteğinin yakında geleceği belirtildiğinden, bu tür mimarilere sahip ekiplerin Hugging Face ve vLLM güncellemelerini yakından takip etmesi faydalı olacaktır.

Kaynaklar

Güne dön