CANLI · 1087 haber akışta Son güncelleme 11:57
19 Eylül 2026
AI · OpenAI

OpenAI LifeSciBench’i Duyurdu: Yapay Zeka, Gerçek Yaşam Bilimleri Görevlerinde Ne Kadar Başarılı?

OpenAI'nin LifeSciBench'i, yapay zekanın gerçek yaşam bilimleri görevlerini 750 uzman sorusuyla ölçüyor; en iyi modelin geçiş oranı ise sadece %36.1.

17 Haziran 2026

Ne oldu?


OpenAI, LifeSciBench adı verilen yeni bir referans değerlendirme setini duyurdu. Bu set, yapay zeka sistemlerinin yaşam bilimlerindeki gerçek dünya görevlerini ve karar süreçlerini ölçmek için tasarlandı. LifeSciBench; biyoloji, ilaç keşfi ve biyoteknoloji gibi alanlarda çalışan 173 doktora seviyesinde bilim insanı tarafından hazırlandı ve 453 bağımsız uzman tarafından gözden geçirildi. Toplam 750 görev, yedi farklı araştırma iş akışını ve yedi biyolojik alanı kapsıyor. Her görev, uzmanların laboratuarda karşılaştığı belirsizlikleri, çelişkili bulguları ve çok adımlı deney tasarımını içeren durumları ele alıyor. Değerlendirme, tek bir doğru cevap yerine 19.020 ayrı rubrik kriteri kullanılarak yapılıyor; bu da modelin bilimsel çıkarım ve yorumlama yetkinliğini ölçüyor.

Neden önemli?


Geleneksel yapay zeka testleri çoğunlukla çoktan seçmeli sorulara veya sınırlı alanlarda bilgi hatırlatmaya dayanıyordu. LifeSciBench ise araştırmacının günlük iş akışına benzeyen görevler sunuyor: eksik kanıtları yorumlama, çelişkili sonuçları uzlaştırma, deneyleri tasarlayıp optimize etme, prosedürleri doğrulama ve riskleri değerlendirme. Bu yaklaşım, modellerin sadece biyoloji bilgisiyle değil, uygulamalı araştırma ve karar verme becerisiyle de ölçülmesini sağlıyor. Ayrıca sektör için yeni bir kalite standardı oluşturma potansiyeli taşıyor; özellikle ilaç ve biyoteknoloji şirketleri, yapay zeka destekli çalışanlarına güvenmeden önce sistemlerin sınırlarını net görebilecek.

Açıklanan sonuçlara göre en güçlü model olan GPT-Rosalind bile görevlerin yalnızca %36.1'ini geçebildi; GPT-5.5 %25.7, Gemini 3.1 Pro ise %23.6 seviyesinde kaldı. Bu oranlar, yaşam bilimlerinde otonom yapay zeka araştırma yardımcılarının hâlâ erken aşamada olduğunu ve insan uzman denetiminin vazgeçilmez olduğunu gösteriyor.

Kim veya ne etkileniyor?


Doğrudan etkilenenler, biyoteknoloji ve ilaç araştırma firmaları, akademik yaşam bilimleri laboratuvarları, yapay zeka modeli geliştiren teknoloji şirketleri ve bu sistemleri klinik öncesi araştırmalarda kullanmayı planlayan araştırmacılar. LifeSciBench aynı zamanda düzenleyici kurumlar ve risk değerlendirme uzmanları için de önemli bir referans olabilir, çünkü yapay zekanın gerçek bilimsel kararlarda ne kadar güvenilir olduğunu somut verilerle ortaya koyuyor.

Ne yapılmalı?


Yaşam bilimleri ekipleri, yapay zekayı yalnızca hızlı özet veya hipotez üretme aracı olarak kullanmalı; kritik deney tasarımı, güvenlik ve yorumlamalar için insan uzman onayını sürdürmeli. Model geliştiriciler için ders ise açık: Çoktan seçmeli sınav başarısı, gerçek araştırma ortamındaki karmaşık, belirsiz ve çok adımlı görevlerin yerini tutmuyor. Şirketler ve akademisyenler, LifeSciBench benzeri uzman-merkezli değerlendirme setlerini kendi alanlarına uyarlayarak yapay zeka sistemlerinin güvenli ve etkili entegrasyonunu hızlandırabilir.

Kaynaklar

Güne dön