Frozen v2: accelerator Google cu siliciu pentru Gemini

Raportat, Google dezvoltă Frozen v2, un accelerator de server care încorporează elemente ale arhitecturii Gemini în siliciu pentru eficiență energetică și latențe reduse. Sosirea este estimată pentru 2028 și vizează aplicații AI în timp real.

Frozen v2: accelerator Google cu siliciu pentru Gemini

4 Minute

Imaginează-ți un cip pentru server care nu doar rulează un model, ci îi urmează subtil planul de funcționare. Inginerii Google construiesc în liniște exact asta: un accelerator de server codat Frozen v2 care încorporează părți din arhitectura Gemini în siliciu, vizând o eficiență mult crescută și latență mai mică.

Informațiile provin dintr-un raport în The Information care citează doi informatori. Afirmația lor este surprinzătoare: Frozen v2 ar putea procesa de șase până la zece ori mai multe tokenuri pe watt decât cele mai recente unități de procesare tensorială ale Google. Data țintă? 2028. Motivația este directă și familiară oricui a urmărit cererea din cloud depășind capacitatea: se spune că Google Cloud a fost nevoit să refuze unele contracte de clienți din cauza unei crize de procesare AI.

Încorporarea arhitecturii în locul regulilor

TPU-urile și GPU-urile tradiționale sunt generaliste. Încarci un model, iar hardware-ul ia o mulțime de decizii la rulare, cum să mute datele, ce operațiuni să programeze, când să acceseze memoria. Acea flexibilitate este puternică, dar are costuri. Frozen v2 adoptă o abordare diferită: fixează anumite decizii specifice Gemini în logica la nivel de tranzistor. Rezultatul: mai puțini pași de execuție și mai puține date transferate per cerere. Mai puține deplasări. Mai puțină suprasarcină. Latență mai redusă. Devine plauzibilă apariția unor noi aplicații AI în timp real.

A existat o idee și mai îndrăzneață în discuție. Proiectele timpurii Frozen conduse de Jeff Dean ar fi încercat, potrivit rapoartelor, să încorporeze greutățile modelului direct în siliciu. Ar fi fost o optimizare radicală. S-ar fi și învechit rapid, pentru că cipurile legate de o singură versiune de model au o durată de viață utilă foarte scurtă. Google a împărțit diferența. Frozen v2 ar încorpora scheletul arhitectural păstrând însă greutățile actualizabile, astfel încât același cip poate deservi mai multe versiuni Gemini, atâta timp cât acestea urmează aceleași tipare arhitecturale.

Această abordare ar putea reduce timpii de răspuns suficient pentru a permite noi categorii de aplicații AI interactive și cu latență scăzută.

Google nu intenționează să înlocuiască flota sa de TPU cu Frozen v2. Gândește-te la el ca la o pistă experimentală care rulează alături de producția de TPU, un teren de testare pentru siliciu mai specializat în timp ce proiectele de modele se stabilizează. Planul de produse pentru TPU s-a separat recent între necesitățile de antrenare și inferență, cu cipuri de generația a opta anunțate la evenimentul Cloud Next din aprilie. Efortul Frozen v2 este de scară mai mică; Google nu plănuiește o producție în masă la același nivel cu TPU-urile.

Sosirea anticipată a Frozen v2 se aliniază și cu alte mișcări din industrie. Google a contractat, potrivit rapoartelor, Intel pentru a ambala peste trei milioane de cipuri TPU până în 2028. Între timp, startupuri și rivali explorează deja siliciul conștient de model. Taalas, din Toronto, a lansat cipul HC1 asociat cu Llama 3.1 8B și afirmă că atinge 17.000 de tokenuri pe secundă fără HBM pe pachet. Startupul a strâns aproximativ 186 milioane de euro în finanțare. Iar anul trecut Nvidia a semnat un acord de licență tehnologică cu Groq evaluat la aproximativ 18,6 miliarde de euro, dovadă că piața vede valoare mare în integrarea comportamentului modelului și a hardware-ului.

Există compromisuri. Încorporarea arhitecturii reduce unele tipuri de flexibilitate. Ea favorizează cazuri de utilizare în care familiile de modele rămân consistente în timp. De asemenea, modifică ciclul de viață al produsului: siliciul conceput în jurul unei arhitecturi de model trebuie justificat prin stabilitate previzibilă a designului și printr-o scară de implementare adecvată. Asta explică poziția precaută a Google. Frozen v2 este experimental; nu orice experiment devine produs.

Deocamdată, Google nu a confirmat public Frozen v2. Un purtător de cuvânt al companiei a reamintit pentru The Information că multe proiecte interne nu ajung niciodată în producție. Totuși, ideea de bază, de a muta o parte din logica modelului în siliciu pentru a economisi energie și a reduce latența, a trecut de la curiozitate academică la strategie competitivă. Ne putem aștepta ca mai multe firme să testeze combinații similare de hardware conștient de model și greutăți actualizabile, pe măsură ce cererea pentru AI eficientă și cu latență scăzută continuă să crească.

Lasă un comentariu

Comentarii

Niciun comentariu încă. Fii primul.