
Un nou model AI de la DeepSeek obține rezultate competitive în teste de performanță, dar diferențele de scor nu determină automat cel mai bun sistem pentru toate activitățile.
Rezultate în teste speciale
Modelul GPT-5.6 Sol a obținut 94,1 puncte în testul GPQA Diamond, comparativ cu 90,9 puncte pentru DeepSeek. La testul Humanity’s Last Exam, scorurile sunt 44,5 pentru GPT-5.6 Sol și 36,8 pentru V4.1 Flash. În testele de programare, Claude Opus 5 are rezultate mai bune pe probe de durată, precum Terminal-Bench 4.0, unde atinge 51,8 puncte, față de 31,2 pentru DeepSeek.
Aspectele de performanță și diferențele între modele
Rezultatele indică avantajul modelului DeepSeek în sarcini specifice, cum ar fi programarea și cybersec-ness. Un scor în anumite benchmark nu va determina cel mai bun model pentru orice activitate AI.
Costuri și eficiența utilizării
Prețul API-ului DeepSeek pentru V4.1 Flash este de 0,15 dolari pentru un milion de tokeni de intrare în afara perioadelor de vârf și 0,60 dolari pentru un milion de tokeni generați. În perioadele de vârf, tarifele se dublează, ajungând la 0,30 și, respectiv, 1,20 dolari.
Tehnologia din spatele V4.1 Flash
DeepSeek afirmă că noua arhitectură permite gestionarea unui număr crescut de solicitări cu resurse mai mici. Modelul V4.1 Flash este conceput pentru a demonstra o direcție în dezvoltarea AI: modele foarte mari, dar care utilizează doar o fracțiune din parametrii în fiecare pas de funcționare.
Capabilități vizuale și aplicații
V4.1 Flash include și funcție de înțelegere vizuală nativă, fiind capabil să prelucreze atât imagini, cât și text fără a fi nevoie de tratamente separate. Modelul este disponibil prin API-ul DeepSeek pentru dezvoltarea de agenți AI.
Performanță comparativă și rezultate în testări de design
DeepSeek susține că V4.1 Flash atinge 98% din performanța GPT-6 Astra într-un test OpenDesign axat pe activități de design, la aproximativ 1,4% din costul modelului GPT-6 Astra. Acest benchmark nu este însă reprezentativ pentru toate domeniile AI și nu poate fi interpretat ca o concluzie generală despre modelele AI.
Noul sistem oferă rezultate promițătoare, dar diferențele >între scoruri nu indică întotdeauna superioritatea unui model pentru orice sarcină.
