
AI modellerinin doğruluktan yoksun olabileceği kaçınılmaz bir sonuçtur. Halüsinasyonlar ve yanlış bilgilere iki katına çıkmak geliştiriciler için devam eden bir mücadele olmuştur. Kullanım, bireysel kullanım durumlarında o kadar çok değişir ki AI doğruluğuyla ilgili ölçülebilir yüzdeleri belirlemek zordur. Bir araştırma ekibi artık bu sayılara sahip olduklarını iddia ediyor.
Tow Dijital Gazetecilik Merkezi yakın zamanda ChatGPT Arama, Perplexity, Perplexity Pro, Gemini, DeepSeek Arama, Grok-2 Arama, Grok-3 Arama ve Copilot dahil olmak üzere sekiz AI arama motorunu inceledi . Her birini doğruluk açısından test ettiler ve araçların ne sıklıkla yanıt vermeyi reddettiğini kaydettiler.
Araştırmacılar 20 haber yayıncısından (her biri 10) 200 haber makalesini rastgele seçtiler. Makaleden alıntılanmış bir bölüm kullanıldığında her hikayenin Google aramasında ilk üç sonuç içinde dönmesini sağladılar. Ardından, her AI arama aracında aynı sorguyu gerçekleştirdiler ve aramanın
A) makaleyi
B) haber kuruluşunu
C) URL'yi doğru bir şekilde alıntılayıp alıntılamadığına göre doğruluğu derecelendirdiler.
Araştırmacılar daha sonra her aramayı doğruluk derecelerine göre "tamamen doğru"dan "tamamen yanlış"a etiketlediler. Aşağıdaki diyagramdan görebileceğiniz gibi, Perplexity'nin her iki versiyonu dışında, AI'lar iyi performans göstermedi. Toplu olarak, AI arama motorları zamanın %60'ında yanlıştır. Dahası, bu yanlış sonuçlar AI'nın bunlara olan "güveni" tarafından güçlendirildi.

Çalışma büyüleyici çünkü birkaç yıldır bildiğimiz bir şeyi niceliksel olarak doğruluyor: LLM'ler "tüm zamanların en kurnaz dolandırıcıları." Söylediklerinin doğru olduğunu, bazen tartışma noktasına varacak veya karşı karşıya geldiklerinde başka yanlış iddialar uyduracak kadar yetkiyle bildiriyorlar.
2023 tarihli bir anekdot makalesinde, Ted Gioia (The Honest Broker) düzinelerce ChatGPT yanıtına işaret ederek botun çok sayıda sorguya yanıt verirken kendinden emin bir şekilde "yalan söylediğini" gösterdi . Bazı örnekler düşmanca sorgular olsa da, çoğu sadece genel sorulardı.
"ChatGPT hakkında duyduklarımın yarısına inansaydım, ben sahilde oturup margarita içerken ve kayıp tuzluğumu ararken The Honest Broker'ın onu ele geçirmesine izin verebilirdim," diye belirtti Gioia, umursamazca.
Yanlış olduğunu kabul etse bile, ChatGPT bu itirafı daha fazla uydurma bilgiyle takip ederdi. LLM, görünüşe göre her kullanıcı girdisini her ne pahasına olursa olsun yanıtlamak üzere programlanmıştır. Araştırmacının verileri bu hipotezi doğruluyor ve ChatGPT Arama'nın 200 makale sorgusunun hepsini yanıtlayan tek yapay zeka aracı olduğunu belirtiyor. Ancak, yalnızca %28 oranında tamamen doğru bir derecelendirme elde etti ve %57 oranında tamamen yanlıştı.

ChatGPT bile en kötüsü değil. X'in Grok AI'sının her iki versiyonu da zayıf performans gösterdi, Grok-3 Search %94 yanlıştı. Microsoft'un Copilot'u 200 sorudan 104'ünü yanıtlamayı reddettiğini düşündüğünüzde çok daha iyi değildi. Geriye kalan 96 sorudan sadece 16'sı "tamamen doğru", 14'ü "kısmen doğru" ve 66'sı "tamamen yanlış"tı, bu da yaklaşık %70 yanlış olduğu anlamına geliyor.
Tartışmasız, tüm bunlardaki en çılgın şey, bu araçları üreten şirketlerin, en son AI modellerine erişmek için halktan ayda 20 ila 200 dolar alırken bu doğruluk eksikliği konusunda şeffaf olmamalarıdır . Dahası, Perplexity Pro (ayda 20 dolar) ve Grok-3 Search (ayda 40 dolar) ücretsiz sürümlerinden (Perplexity ve Grok-2 Search) biraz daha fazla sorguyu doğru yanıtladı ancak önemli ölçüde daha yüksek hata oranlarına sahipti (yukarıda). Bir eksiden bahsedelim.
Ancak herkes aynı fikirde değil. TechRadar'dan Lance Ulanoff, ChatGPT Search'ü denedikten sonra bir daha asla Google kullanmayabileceğini söyledi. Aracı hızlı, bilinçli ve doğru, temiz ve reklamsız bir arayüze sahip olarak tanımlıyor .
Kaynak :
https://www.techspot.com/news/107101-ne ... rcent.html


