MentalHealthBench: OpenAI, yapay zeka modellerinin ruh sağlığı yanıtlarını ölçüyor
MentalHealthBench neyi ölçüyor?
OpenAI, yapay zeka modellerinin ruh sağlığıyla ilgili sorulara verdiği yanıtları değerlendirmek amacıyla MentalHealthBench adlı aracı tanıttı. Araç, yanıtların güvenli ve doğru olma düzeyini incelemeye odaklanıyor.
Çalışma, 22 ülkeden 80’den fazla ruh sağlığı uzmanının katkısıyla hazırlandı. Değerlendirme setinde 1.215 sentetik ruh sağlığı konuşması bulunuyor. Bu konuşmalar, uzmanlar tarafından oluşturulan toplam 5.262 kriter üzerinden puanlandırıldı.
Değerlendirmede hangi senaryolar yer alıyor?
MentalHealthBench kapsamında farklı ciddiyet düzeylerindeki durumlar, acil ruh sağlığı krizleri ve çeşitli kullanıcı profilleri ele alınıyor. Böylece modellerin farklı ruh sağlığı koşullarına ve kullanıcı ihtiyaçlarına nasıl karşılık verdiği karşılaştırılabiliyor.
- Düşük ve yüksek ciddiyet düzeyindeki ruh sağlığı senaryoları inceleniyor.
- Acil ruh sağlığı krizlerine verilen yanıtlar değerlendiriliyor.
- Farklı kullanıcı profillerine yönelik yanıtların güvenliği ve doğruluğu puanlanıyor.
- Sonuçlar, uzmanların belirlediği değerlendirme kriterleriyle karşılaştırılıyor.
Hangi modeller daha yüksek puan aldı?
Araştırma bulgularında yer alan sonuçlara göre GPT-6 Astra yüzde 57,3 başarı oranıyla ilk sırada gösterildi. GPT-4o ise yüzde 32,1 oranıyla ikinci sırada yer aldı.
Bu oranlar, yapay zeka modellerinin ruh sağlığı konularındaki yanıtlarında ilerleme olduğunu gösterirken, değerlendirme ölçütlerinin tamamında yüksek performans sağlanamadığına da işaret ediyor.
Araç kimlerin kullanımına açıldı?
OpenAI, MentalHealthBench aracını kamuya açık biçimde yayımladı. Bu adım, araştırmacıların ve geliştiricilerin yapay zeka sistemlerinin ruh sağlığı yanıtlarını daha ayrıntılı biçimde incelemesine imkân tanıyor.
İlgili İçerikler
Sıkça Sorulan Sorular
MentalHealthBench nedir?
MentalHealthBench, yapay zeka modellerinin ruh sağlığı konularındaki yanıtlarını güvenlik ve doğruluk açısından değerlendirmek için OpenAI tarafından geliştirilen bir araçtır.
MentalHealthBench kaç konuşmayı kapsıyor?
Değerlendirme setinde 1.215 sentetik ruh sağlığı konuşması bulunuyor.
MentalHealthBench nasıl geliştirildi?
Araç, 22 ülkeden 80’den fazla ruh sağlığı uzmanının katkısıyla ve 5.262 değerlendirme kriteri kullanılarak hazırlandı.
Bulgularda en yüksek puanı hangi model aldı?
Araştırma bulgularında GPT-6 Astra yüzde 57,3 başarı oranıyla ilk sırada gösteriliyor.
Kaynaklar: openai.com , thegenaimagazine.com






