Google a integrat un model AI de 28,9 milioane de parametri într-un cip de 10 dolari

0
23
a-inghesuit-un-model-ai-cu-28,9-milioane-de-parametri-intr-un-cip-de-10-dolari.-trucul-google-care-a-facut-imposibilul-posibil
A înghesuit un model AI cu 28,9 milioane de parametri într-un cip de 10 dolari. Trucul Google care a făcut imposibilul posibil

Un nou model de inteligență artificială, adaptat pentru microcontrolere cu resurse limitate, folosește o tehnică inspirată de Google pentru a reduce consumul de memorie fără a compromite performanța.

Aproape 30 de milioane de parametri pe un cip mic

Microcontrolerul ESP32-S3, utilizat în acest proiect, are doar 512 KB SRAM și 8 MB de PSRAM, insuficiente pentru încărcarea unui model AI cu aproape 29 de milioane de parametri. Un foto realizat cu telefonul modern ocupă de obicei mai mult spațiu decât memoria rapidă disponibilă pe cip. Pentru a adapta modelul la aceste limitări, dezvoltatorii au redus precizia parametrilor la 4 biți, obținând o dimensiune totală de 14,9 MB după cuantizare. Acest fișier se încadrează în memoria flash de 16 MB a plăcii. Performanța estimată a modelului este de aproximativ 9,5 tokenuri generate pe secundă.

Beneficiile cipului ESP32-S3

Acest microcontroler este ieftin și consumă puțină energie, fiind potrivit pentru dispozitive autonome precum electrocasnice, jucării sau senzori. Datorită acestor caracteristici, poate funcționa fără conexiune constantă la cloud, facilitând implementarea AI în dispozitive integrate.

Tehnica de eficientizare utilizată

Soluția principală a proiectului se bazează pe o metodă numită Per-Layer Embeddings, inspirată de arhitectura Gemma dezvoltată de Google. În loc să încarce întregul tabel de embedding-uri în memoria rapidă, acesta este stocat în memoria flash. Tabla conține aproximativ 25 de milioane de parametri, dar, datorită separării, sistemul accesează doar rândurile necesare în momentul generării fiecărui cuvânt, reducând astfel semnificativ cerințele de memorie.

Gestionarea memoriei pentru performanță

Memoria flash, mai lentă decât SRAM-ul, găzduiește tabelul de embedding-uri. Sistemul accesează doar fragmentul relevant pentru calcul, iar nucleul de procesare doar citește și procesează parametrii necesari, păstrând memoria rapidă eliberată pentru procesarea principală a rețelei neurale. Această abordare permite rularea unor modele mult mai mari decât specificațiile hardware-ului ar sugera.

Implicările tehnologiei

Tehnica adoptată permite reducerea semnificativă a spațiului de memorie necesar pentru modelele AI, dar menține funcționalitatea și performanța. În plus, această metodă contribuie la creșterea autonomiei dispozitivelor electronice echipate cu microcontrolere performante, dar limitate din punct de vedere al resurselor.

Descrierea tehnologiei relevă o direcție importantă în dezvoltarea AI pentru dispozitive cu resurse limitate, adaptată pentru aplicații variate și justificată de avantajele în cost, consum și autonomie.

LĂSAȚI UN MESAJ

Vă rugăm să introduceți comentariul dvs.!
Introduceți aici numele dvs.