Gemini 3.5 Transcribe, noul AI Google pentru dictare în peste 85 de limbi

0
13
gemini-3.5-transcribe-este-noul-ai-google-pentru-dictare,-cu-suport-pentru-peste-85-de-limbi
Gemini 3.5 Transcribe este noul AI Google pentru dictare, cu suport pentru peste 85 de limbi

Google lansează Gemini 3.5 Transcribe, noul model AI pentru transcriere audio în text

Google a anunțat introducerea unui nou model de inteligență artificială pentru transcrierea vorbirii, denumit Gemini 3.5 Transcribe. Compania afirmă că acesta reprezintă cel mai precis sistem de speech-to-text dezvoltat până în prezent și că deja este utilizat în mai multe aplicații Google, inclusiv în Gboard Rambler pe Android.

Caracteristici principale ale Gemini 3.5 Transcribe

Modelul este capabil să înțeleagă mai bine discursul natural, inclusiv ezitările, corectările făcute în timpul conversației, termenii tehnici și zgomotul de fundal. Aceasta duce la obținerea unor transcrieri mai clare și mai bine structurate.

Un avantaj esențial al sistemului este gestionarea situațiilor în care utilizatorul se răzgândește în timpul vorbirii. De exemplu, dacă cineva spune „ne întâlnim marți, nu, miercuri”, modelul identifică corecția și este capabil să reflecte această schimbare în textul final, eliminând ezitările și expresiile neesențiale precum „ăă” sau „mmm”.

De asemenea, Gemini 3.5 Transcribe poate organiza automat textul și permite modificări vocale simple, oferind astfel o experiență vocală mai fluentă pentru utilizatori.

Performanțe și acuratețe

Google susține că modelul are o rată medie de eroare de 4% pentru transcrierea în timp real. Pentru scenariile în care audio-ul este procesat fără constrângeri de streaming, rata de eroare scade la 2,6%. Aceste cifre sunt rezultatul măsurătorilor efectuate de Artificial Analysis.

Modelul recunoaște vocabular personalizat, inclusiv nume neobișnuite, termeni tehnici, coduri sau identificatori alfanumerici, fiind util în domenii specializate. De asemenea, poate detecta și transcrie automat peste 85 de limbi, chiar și în cazul dialectelor regionale și al accentelor.

Recunoașterea multiplelor persoane și reducerea timpului de procesare

Gemini 3.5 Transcribe nu se limitează la transcrierea pentru dictare. În cazul înregistrărilor preînregistrate, poate atribui replicile diferiților vorbitori și include marcaje temporale. Funcția pentru identificarea mai multor vorbitori poate urmări până la trei persoane în prezent, deși suportul pentru mai mulți vorbitori este încă în fază experimentală.

Comparativ cu modelul Chirp 3, lansat în 2025, noul sistem reduce timpul necesar pentru obținerea transcrierii finale cu aproximativ 70%, conform datelor Google.

Performanțe pe benchmark-uri și recunoaștere multilingvă

Pe testul FLEURS, modelul a obținut o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming pentru setul de limbi și regiuni evaluate. Aceste rezultate evidențiază performanța sa la nivel multilingv.

Google continuă să integreze Gemini 3.5 Transcribe în produsele sale, iar tehnologia promite să îmbunătățească acuratețea și eficiența procesului de transcriere audio în text.

LĂSAȚI UN MESAJ

Vă rugăm să introduceți comentariul dvs.!
Introduceți aici numele dvs.