Google'ın TurboQuant sıkıştırma teknolojisi LLM bellek kullanımını 6 kat azaltıyor

Hardware (Donanım) konusunda bilgi paylaşım alanıdır.
Cevapla
Kullanıcı avatarı
velociraptor
Yottabyte4
Yottabyte4
Mesajlar: 54889
Kayıt: 14 Mar 2006, 02:33
cinsiyet: Erkek
Teşekkür etti: 21139 kez
Teşekkür edildi: 12490 kez

Google'ın TurboQuant sıkıştırma teknolojisi LLM bellek kullanımını 6 kat azaltıyor

Mesaj gönderen velociraptor »

Resim

Google, performansı veya çıktı kalitesini düşürmeden büyük dil modellerinin bellek kullanımını önemli ölçüde azaltmak için tasarlanmış üç yapay zeka sıkıştırma algoritması geliştirdi: TurboQuant, PolarQuant ve Quantized Johnson-Lindenstrauss. Her üçü de vektör niceleme kullanıyor; bu, bellek fiyatlarının rekor seviyelere ulaştığı bir dönemde yapay zeka şirketlerinin donanım maliyetlerini düşürmesine yardımcı olabilecek bir veri optimizasyon tekniği.

LLM'ler için en büyük bellek yükü, kullanıcılar yapay zekâ sohbet botlarıyla etkileşim kurarken konuşma bağlamını depolayan anahtar-değer önbelleğidir. Konuşmalar uzadıkça önbellek büyür ve hem bellek kullanımını hem de güç tüketimini artırır. TurboQuant, " sıfır doğruluk kaybı " ile model boyutunu küçülterek, vektör arama verimliliğini artırarak ve anahtar-değer önbelleği darboğazlarını hafifleterek bu sorunu çözmektedir.

Resim

PolarQuant adı verilen, veri vektörlerini rastgele döndürerek geometrilerini basitleştiren ve böylece büyük sürekli değer veri kümelerini eşleştirmek için standart, yüksek kaliteli bir niceleyici uygulamayı kolaylaştıran yüksek sıkıştırmalı bir yöntem kullanarak bunu başarıyor. Eğer reklamda belirtildiği gibi performans gösterirse, tüketici akıllı telefonlarında ve dizüstü bilgisayarlarında yapay zeka işlemeyi önemli ölçüde artırabilir, daha fazla bağlamı korumalarını ve daha uzun sohbet robotu konuşmalarını desteklemelerini sağlayabilir.

Çıktıdaki hataları en aza indirmek için TurboQuant, matematiksel bir hata düzeltme mekanizması görevi gören ve sapmayı azaltarak doğruluğu artıran Nicelleştirilmiş Johnson-Lindenstrauss algoritmasını uygulamak için 1 bit sıkıştırma kullanır. Algoritma, yüksek hassasiyetli sorguları düşük hassasiyetli, basitleştirilmiş verilerle dengeleyen ve girdinin hangi kısımlarının en alakalı olduğunu ve hangilerinin göz ardı edilebileceğini belirleyen "dikkat puanı"nı hesaplamak için özel bir tahminleyici kullanır.

Resim

Google, açık kaynaklı Gemma ve Mistral LLM'lerini kullanarak LongBench, Needle in a Haystack, ZeroSCROLLS, RULER ve L-Eval dahil olmak üzere bir dizi standart uzun bağlamlı kıyaslama testinde üç algoritmanın tamamını değerlendirdi. Sonuçlar, TurboQuant'ın hem nokta çarpımı bozulmasında hem de geri çağırmada güçlü performans gösterdiğini ve anahtar-değer bellek ayak izini en az 6 kat azalttığını göstermektedir.

Google'ın yapay zeka mühendisleri, yeni algoritmaların yalnızca Gemini gibi çok modlu LLM'lerin aşırı bellek gereksinimlerini azaltmakla kalmayıp, aynı zamanda görev açısından kritik uygulamalar için gereken verimliliği ve doğruluğu da sağlayabileceğine inanıyor. Bununla birlikte, verimli çevrimiçi vektör nicelemesinin faydaları, anahtar-değer önbellek darboğazını gidermenin ötesine geçerek, minimum bellek kullanımı, sıfıra yakın gecikme ve yüksek doğrulukla iyileştirilmiş web arama sonuçları elde edilmesini sağlıyor.

Resim

Yeni yapay zeka algoritmaları, son aylarda yapay zeka patlaması nedeniyle girdi maliyetlerinde keskin bir artış yaşayan ve bu durumun küresel bellek kıtlığına ve DRAM fiyatlarının rekor seviyelere çıkmasına yol açtığı küresel tüketici elektroniği sektörü için bir umut ışığı sunuyor . TurboQuant vaadini yerine getirirse, yapay zeka veri merkezleri için yüksek bant genişliğine sahip bellek gereksinimlerini azaltabilir ve potansiyel olarak yakın gelecekte tüketici elektroniği fiyatlarının istikrar kazanmasına yardımcı olabilir.

Kaynak :
https://www.techspot.com/news/111842-go ... ge-6x.html
Kullanıcı avatarı
Kayserilifatih
Exabyte1
Exabyte1
Mesajlar: 10299
Kayıt: 30 Ağu 2024, 20:48
cinsiyet: Erkek
Teşekkür etti: 968 kez
Teşekkür edildi: 7687 kez

Re: Google'ın TurboQuant sıkıştırma teknolojisi LLM bellek kullanımını 6 kat azaltıyor

Mesaj gönderen Kayserilifatih »

Metinde ifade edilen terimleri hiç duymadım umarım işe yarar bir şeydir
Cevapla