Yapay zeka mantık testinden kaldı

PC ve Teknoloji dünyasından son haberlere buradan ulaşabilirsiniz.
Cevapla
Kullanıcı avatarı
velociraptor
Yottabyte4
Yottabyte4
Mesajlar: 54948
Kayıt: 14 Mar 2006, 02:33
cinsiyet: Erkek
Teşekkür etti: 21290 kez
Teşekkür edildi: 12565 kez

Yapay zeka mantık testinden kaldı

Mesaj gönderen velociraptor »

Resim

Gittikçe daha fazla AI şirketi, modellerinin akıl yürütebildiğini söylüyor. Son zamanlarda yapılan iki çalışma ise aksini söylüyor. Mantıklarını göstermeleri istendiğinde, çoğu model görevi ıskalıyor - akıl yürütmediklerini, daha çok kalıpları tekrarladıklarını kanıtlıyor. Sonuç: kendinden emin cevaplar, ancak akıllıca cevaplar değil.

Apple araştırmacıları, günümüzün en çok abartılan AI sistemlerindeki temel bir zayıflığı ortaya çıkardı: adım adım akıl yürütme gerektiren bulmacaları çözmede başarısız oluyorlar. Yeni bir makalede, ekip Hanoi Kulesi'nde, asırlardır var olan bir mantık bulmacasında birkaç önde gelen modeli test etti ve karmaşıklık arttıkça performansın çöktüğünü buldu.

Hanoi Kulesi bulmacası basittir: Sıra ve disk boyutuyla ilgili kuralları izleyerek bir disk yığınını bir çividen diğerine taşıyın. İnsanlar için bu, planlama ve yinelemeli mantığın klasik bir testidir. Bir sonraki jetonu tahmin etmek üzere eğitilen dil modelleri için zorluk, hedefi kaybetmeden birden fazla adımda sabit kısıtlamalar uygulamaktır.

Apple'ın araştırmacıları modellerden bulmacayı çözmelerini istemediler; adımlarını açıklamalarını istediler. Çoğu iki veya üç disk kullanırken, disk sayısı arttıkça mantıkları çözüldü. Modeller kuralları yanlış ifade etti, önceki adımlarla çelişti veya kendinden emin bir şekilde geçersiz hamleler yaptı; hatta düşünce zinciri istemleriyle bile. Kısacası, akıl yürütmüyorlardı; tahmin yürütüyorlardı.

Bu bulgular, ETH Zürih ve INSAIT'teki araştırmacıların 2025 ABD Matematik Olimpiyatı'ndaki problemler üzerinde en iyi AI modellerini test ettiği Nisan ayındaki bir çalışmayı yansıtıyor - tam yazılı kanıtlar gerektiren bir yarışma. Yaklaşık 200 denemeden hiçbiri mükemmel bir çözüm üretmedi . Daha güçlü performans gösterenlerden biri olan Google'ın Gemini 2.5 Pro, toplam puanın yüzde 24'ünü kazandı - problemlerin yüzde 24'ünü çözerek değil, her denemede kısmi krediler alarak. OpenAI'nin o3-mini'si yüzde 2'yi zar zor geçti.

Resim

Modeller sadece cevapları kaçırmakla kalmadılar - temel hatalar yaptılar, adımları atladılar ve kendinden emin görünürken kendileriyle çeliştiler. Bir problemde, bir model güçlü başladı ancak geçerli durumları açıklama yapmadan hariç tuttu. Diğerleri, bağlama uymasa bile her zaman son cevapları kutulamak gibi eğitim tuhaflıklarına dayalı kısıtlamalar icat ettiler.

Uzun zamandır yapay zeka abartılarını eleştiren Gary Marcus, Apple'ın bulgularının "büyük dil modelleri için oldukça yıkıcı" olduğunu söyledi .

"LLM'lerin Hanoi'yi güvenilir bir şekilde çözememesi gerçekten utanç verici," diye yazdı. "Eğer 1957'de AI'nın gerçek 'vaftiz babalarından' biri olan Herb Simon'ın AI ile çözdüğü ve birinci dönem AI öğrencilerinin rutin olarak çözdüğü bir problemi çözmek için bir milyar dolarlık AI sistemini kullanamıyorsanız, Claude veya o3 gibi modellerin AGI'ye ulaşma şansı gerçekten uzak görünüyor."

Açık algoritmalar verildiğinde bile, model performansı iyileşmedi. Çalışmanın eş lideri Iman Mirzadeh bunu açıkça şöyle ifade etti:

"Bunların süreci mantıklı ve akıllıca değil."

Sonuçlar, akıl yürütme gibi görünen şeyin çoğunlukla sadece örüntü eşleştirmesi olduğunu, yani istatistiksel olarak akıcı ancak mantığa dayalı olmadığını gösteriyor.

Tüm uzmanlar bunu küçümsemedi. Yapay zeka sistemleri konusunda uzmanlaşmış bir yazılım mühendisi olan Sean Goedecke, başarısızlığı ifşa edici olarak gördü .

"Model hemen 'tüm bu hareketleri manuel olarak üretmenin imkansız olduğuna' karar veriyor çünkü binin üzerinde hareketi takip etmeyi gerektiriyor. Bu yüzden bir kısayol bulmaya çalışıyor ve başarısız oluyor," diye yazdı Apple çalışması analizinde. "Buradaki temel içgörü, belirli bir karmaşıklık eşiğinden sonra modelin akıl yürütmek için çok fazla adım olduğuna karar vermesi ve akıllıca kısayollar aramaya başlamasıdır. Yani sekiz veya dokuz diskten sonra, araştırılan beceri sessizce 'model Hanoi Kulesi dizisini akıl yürütebilir mi?'den 'model diziyi akıl yürütme zorunluluğunu atlayan genelleştirilmiş bir Hanoi Kulesi çözümü bulabilir mi?'ye değişiyor."

Resim

Goedecke, modellerin akıl yürütmede umutsuz olduğunu kanıtlamak yerine, bulguların AI sistemlerinin davranışlarını baskı altında nasıl uyarladıklarını vurguladığını öne sürdü - bazen akıllıca, bazen de değil. Başarısızlık sadece adım adım akıl yürütmede değil, çok kullanışsız hale geldiğinde görevi terk etmekte.

Teknoloji şirketleri genellikle simüle edilmiş akıl yürütmeyi bir atılım olarak vurgular. Apple makalesi, düşünce zinciri akıl yürütmesi için ince ayarlanmış modellerin bile bilişsel yük arttığında bir duvara çarpma eğiliminde olduğunu doğruluyor - örneğin, Hanoi Kulesi'nde izleme altı diskin ötesine geçtiğinde. Modellerin iç mantığı çözülüyor ve bazıları rasyonel açıklamaları taklit ederek yalnızca kısmi başarı elde ediyor. Çok azı neden ve sonuç veya hedef odaklı davranış konusunda tutarlı bir kavrayış sergiliyor.

Apple ve ETH Zürih çalışmalarının sonuçları, şirketlerin bu modelleri pazarlama biçimleriyle taban tabana zıttır; karmaşık, çok adımlı görevleri idare edebilen yetenekli akıl yürütücüler olarak. Pratikte, akıl yürütme olarak geçen şey genellikle sadece ekstra adımlarla gelişmiş otomatik tamamlamadır. Zeka yanılsaması akıcılıktan ve biçimlendirmeden kaynaklanır, gerçek içgörüden değil.

Apple makalesi kapsamlı düzeltmeler önermekten kaçınıyor. Ancak, büyük dil modellerini sembolik mantık, doğrulayıcılar veya göreve özgü kısıtlamalarla birleştiren hibrit yaklaşımlara yönelik artan çağrılarla örtüşüyor. Bu yöntemler yapay zekayı gerçekten zeki yapmayabilir, ancak güvenle yanlış cevapların gerçekler olarak sunulmasını önlemeye yardımcı olabilir.

Bu tür ilerlemeler gerçekleşene kadar, simüle edilmiş akıl yürütmenin adının ima ettiği şey olarak kalması muhtemeldir: simüle edilmiş. Faydalıdır - bazen etkileyicidir - ancak gerçek zekadan uzaktır.

Kaynak :
https://www.techspot.com/news/108294-ai ... usion.html
Kullanıcı avatarı
Kayserilifatih
Exabyte1
Exabyte1
Mesajlar: 10357
Kayıt: 30 Ağu 2024, 20:48
cinsiyet: Erkek
Teşekkür etti: 972 kez
Teşekkür edildi: 7745 kez

Re: Yapay zeka mantık testinden kaldı

Mesaj gönderen Kayserilifatih »

Yapay zeka (!) hiçbir zaman insan zekasının yerini tutamaz yani sen onu eğitirsen daha zeki gibi görünür veya o ölçüde zeki (!) olabilir ama özünde hiç de bahsedildiği gibi zeki değildir
Cevapla

“Teknoloji ve bilim haberleri” sayfasına dön