Al momento stai visualizzando DeepSeek V4.1-Flash: il modello più piccolo della nuova famiglia punta su efficienza e costi

DeepSeek V4.1-Flash: il modello più piccolo della nuova famiglia punta su efficienza e costi

DeepSeek ha presentato V4.1-Flash, descritto come il modello più piccolo della sua nuova famiglia di architetture e dotato di comprensione visiva nativa. La società lo posiziona come una soluzione pensata per offrire maggiore capacità, inferenza più rapida, throughput più alto e la possibilità di scalare verso modelli di dimensioni maggiori. Le informazioni arrivano dalla pagina pubblicata su aisecret.us.

Cosa cambia nell’architettura

Il modello introduce una nuova architettura chiamata Causal Encoder-Decoder, con 8 miliardi di parametri attivi per l’input e 16 miliardi per l’output. DeepSeek afferma che i nuovi metodi di pretraining, combinati con un post-training RL su scala più ampia, portano V4.1-Flash a superare nei benchmark i modelli di punta, incluso DeepSeek-V4-Pro.

Un aspetto centrale riguarda la gestione della KV cache: rispetto alla generazione precedente, V4.1-Flash ne richiede una quantità molto inferiore. Poiché i costi legati ai cache-hit pesano spesso in modo rilevante sulle spese degli agenti, comprimere la cache si traduce in un risparmio significativo.

Impatto su modelli precedenti e prezzi

La transizione coinvolge anche i modelli esistenti. V4-Flash e V4-Flash-Vision-Exp vengono ritirati; per garantire compatibilità, gli identificatori deepseek-v4-flash e deepseek-v4-flash-vision-exp vengono temporaneamente indirizzati a V4.1-Flash. Inoltre, a partire dalle 04:00 UTC del 14 settembre 2026, tutte le richieste a deepseek-v4-pro saranno instradate verso V4.1-Flash, alle tariffe di V4.1-Flash, fino al lancio di V4.1-Pro. DeepSeek dichiara di stare progressivamente dismettendo V4-Pro.

Sul fronte dei costi, l’azienda indica tariffe off-peak pari al 50% di quelle di picco, suggerendo di pianificare i carichi di lavoro flessibili nelle fasce fuori picco per risparmiare. V4.1-Flash, secondo quanto comunicato, consente di servire più utenti a un costo inferiore, con i risparmi trasferiti agli utilizzatori.

Supporto e disponibilità

I partner ufficiali WorkBuddy (incluso CodeBuddy) e OpenCode supportano già V4.1-Flash. DeepSeek afferma inoltre che collaborerà con la comunità open source per il supporto all’inferenza di V4.1-Flash e per esplorare ulteriori opzioni di deployment. La pagina menziona anche la possibilità di discutere deployment su larga scala con 2.000 GPU e uno storage cluster.

A chi può essere utile

Il modello sembra rivolto a chi sviluppa agenti e applicazioni che fanno ampio uso di cache e contesti lunghi, dove il costo per richiesta è un fattore determinante. La promessa di un modello più piccolo ma con prestazioni dichiarate superiori ai flagship precedenti interessa anche chi valuta il rapporto tra qualità, velocità e spesa operativa.

Dettagli da verificare

Le informazioni disponibili provengono dalla comunicazione della stessa DeepSeek e non includono dati indipendenti sui benchmark, sulle effettive riduzioni di costo né sulle modalità di accesso. Restano da chiarire le condizioni precise delle tariffe, i limiti d’uso e le tempistiche definitive del passaggio da V4-Pro. Chi valuta una migrazione dovrebbe attendere conferme e test autonomi prima di modificare i propri flussi di produzione.

Lascia un commento