Yapay Zekâya Doktora Düzeyinde Performans Testi: Yeni “LifeSciBench” Tanıtıldı!

Yapay Zekâya Doktora Düzeyinde Performans Testi: Yeni “LifeSciBench” Tanıtıldı!

ChatGPT, yapay zekâların daha gelişmiş noktalar üzerinden testlere girmesini sağlayacak yeni LifeSciBench’i tanıttı.

Ajan tabanlı yapay zekâ sistemleri, bilimsel görevleri yerine getirme konusunda her geçen gün daha yetenekli hâle geliyor ancak bu sistemlerin yaşam bilimleri araştırmacıları için gerçekten yararlı olup olmadığı, gerçek araştırmaların karmaşıklığıyla ne kadar iyi başa çıkabildiklerine bağlı.

Gerçek bilimsel çalışmalar, ne yazık ki tek bir bilgi-geri çağırma sorusu ya da temiz bir tahmin probleminden ibaret değil. Gerçek hayatta araştırmacılar eksik kanıtları yorumlamak, çelişkili sonuçları uzlaştırmak, zorlu deneyler tasarlamak, hataları gidermek, riskleri değerlendirmek ve belirsizlik altında bir sonraki adımın ne olacağına karar vermek zorunda.

ChatGPT LifeSciBench ne işe yarıyor?

1200xauto 1 1

Mevcut yapay zekâ kıyaslama testleri ise bu yetenekleri tam olarak yakalayamıyor. Yaşam bilimleri alanındaki pek çok değerlendirme, dar alanlara veya izole edilmiş becerilere odaklanıyor, bu da yapılandırılmış soru formatları ve temiz referans cevaplar doğuruyor. Bu testler elbette değerli ancak bir modelin araştırma düzeyindeki daha geniş iş kollarına gerçekten katkıda bulunup bulunamayacağını değerlendirmekte yetersiz kalıyor.

İşte tam bu boşluğu kapatmak amacıyla ChatGPTLifeSciBench‘i tasarladığını söylüyor. Bu testteki her bir görev, biyoteknoloji ve ilaç geliştirme programlarında doğrudan deneyimi olan, doktora (Ph.D.) düzeyinde eğitim almış uzman yaşam bilimcilerin muhakemelerine dayanıyor.

LifeSciBench tam olarak neyi ölçüyor?

LifeSciBench, yapay zekâ sistemlerinin sadece biyoloji sorularını yanıtlayıp yanıtlayamadığını değil, gerçekçi yaşam bilimleri araştırma görevlerini destekleyip destekleyemediğini ölçüyor. Şirket, bu kıyaslama testinin sınıflandırmasını tanımlamak için çalışan yaşam bilimcilerle, uygulamalı araştırma ortamlarında en sık kullandıkları iş akışları hakkında anketler yapıldığını söylüyor.

Modellerin değerlendirilmesi de sıradan testler gibi olmuyor. Uzmanlar tarafından yazılan rubrikler, bir modelin belirli bir problem için doğru cevabı üretip üretemediğini ölçerken aynı zamanda bir bilim insanının bekleyeceği doğru detay seviyesini, gerekçelendirmeyi, uyarıları ve biçimlendirmeyi sunup sunamadığını da inceliyor.

Özetle yapay zekânın sadece ezberci bir asistan mı yoksa bilime yön verebilecek gerçek bir iş ortağı mı olduğunu artık LifeSciBench belirleyecek.


Neural Sage

YZ Hocası haber editörü. Yapay Zekâ Haberleri, AI News, yapay zeka ve dünya çapındaki yeni teknolojiler alanındaki en son gelişmeleri siz değerli YZ Hocası okuyucuları için derlemektedir.

⚡ HAFTANIN PROMPTU

Bir nesnenin yapısını, kullanım amacını ve temel özelliklerini üç farklı görsel anlatımla tanıtmak için kullanılır.

Yüklediğim nesnenin fotoğrafını kullanarak üç bölümlü tek bir görsel oluştur. Sol bölümde nesneyi “exploded view” tarzında göster. Ana parçalarını düzenli aralıklarla ayır ve birbirleriyle ilişkilerini koru. Orta bölümde nesnenin adını ve kullanım amacını, dokulu bir kâğıt üzerine doğal ve okunaklı el yazısıyla yaz. Sağ bölümde nesnenin üç temel özelliğini, farklı pastel renklerdeki yapışkan notlara yerleştir. Her notta kısa bir ifade bulunsun. Nesnenin rengini ve tasarımını referans fotoğrafla uyumlu tut. İç yapısı görünmüyorsa oluşturduğun parçaların temsili olduğunu küçük bir notla belirt. Açık renkli sade bir arka plan, yumuşak ışık ve dengeli bir yerleşim kullan. Tüm yazılar Türkçe olsun. Görseli 16:9 yatay formatta hazırla.

Yorumlar (0)

Bir Yorum Bırakın