
Üretken AI hizmetleri şu anda teknoloji sektöründeki her CEO'nun hayal gücünü gıdıklıyor. Milyonlarca çalışanın yerini almaları ve neredeyse her şeyi otomatikleştirmeleri bekleniyor, ancak MIT araştırmacıları AI modellerinin karmaşık sistemlerin "kurallarını" gerçekten kavramadığı konusunda uyarıyor.
Büyük bir dil modeli (LLM) insan zekasını taklit edebilir ve bir kullanıcının metinsel istemine dayanarak çok ikna edici sonuçlar sağlayabilir. Ancak, model yalnızca, bazen inanılmaz bir kesinlikle, belirli bir metinsel bağlamda önceki sözcüklerin yanına koyulacak en iyi sözcükleri tahmin eder. LLM'ler öngörülemeyen, gerçek dünya koşullarıyla karşı karşıya kaldıklarında, çıktıları hızla güvenilmez hale gelebilir.
MIT araştırmacıları, üretken AI sistemlerinin dünyayı anlayıp anlayamadığını doğru bir şekilde doğrulamak için, New York şehrinde adım adım yol tarifi verme yeteneklerini kontrol etmek gibi yeni ölçütler geliştirmeye çalıştılar. Araştırmacılar, yakın zamanda yaptıkları bir çalışmada , modern LLM'lerin dünya modellerini "örtük" olarak öğrendiklerini , ancak bu görünüşte dikkat çekici "zeka" gösterisini doğru bir şekilde değerlendirmenin resmileştirilmiş bir yolu olması gerektiğini söyledi.
Ekip, GPT-4 gibi popüler servisler tarafından kullanılan bir tür üretken AI modeli olan dönüştürücülere odaklandı. Dönüştürücüler, dil tabanlı verilerin devasa veri tabanlarında eğitilir, böylece metin tahmini işlerinde oldukça yetenekli hale gelirler. Araştırmacılar daha sonra, deterministik sonlu otomasyon (DFA) olarak bilinen bir problem sınıfı kullanarak üretken AI tahminlerini değerlendirdiler.

DFA tanımı, mantıksal akıl yürütme, coğrafi navigasyon, kimya veya oyun oynama gibi farklı türden sorunları içerir. MIT bilim insanları, yapay zekanın temeldeki kuralları doğru bir şekilde anlama yeteneğini test etmek için iki farklı sorun seçtiler: New York sokaklarında araba kullanmak ve Othello oynamak. Harvard doktora sonrası araştırmacısı Keyon Vafa, "Dünya modelinin ne olduğunu bildiğimiz test yataklarına ihtiyacımız vardı. Şimdi, o dünya modelini kurtarmanın ne anlama geldiğini titizlikle düşünebiliriz" dedi.
Test edilen transformatörler genellikle doğru yönler ve geçerli Othello hareketleri üretebildi, ancak araştırmacılar New York haritasına sapmalar eklediğinde kötü performans gösterdiler. Bu özel örnekte, tüm üretken AI modelleri sapmaları düzgün bir şekilde "okuyamadı", aslında var olmayan rastgele uçuş yolları veya "imkansız" yönelimlere sahip sokaklar önerdi.
Vafa, tek bir sapma eklendikten sonra üretken AI performansının hızla kötüleştiğini belirtti. Haritadaki olası sokakların yalnızca yüzde 1'ini kapattıktan sonra, model doğruluğu neredeyse yüzde 100'den yalnızca yüzde 67'ye düştü. Çalışma sonuçları, transformatör tabanlı LLM'lerin belirli görevlerde doğru olabileceğini ancak doğru dünya modellerini anlamadıklarını veya yakalamadıklarını gösteriyor. Ya da bilgisayar bilimci Alan Blackwell'in ünlü sözünde dediği gibi, saçmalıkları tekrar tekrar otomatikleştiriyoruz.
Kaynak :
https://www.techspot.com/news/105519-ge ... world.html


