La stagione dei prezzi ultra-low cost senza vincoli subisce una svolta netta.Con l’uscita dalla fase preliminare e il debutto in General Availability dei modelli DeepSeek-V4-Flash e DeepSeek-V4-Pro, la startup cinese ha abbandonato la tariffa flat per introdurre una tariffazione dinamica Peak / Off-Peak.
Ecco i dettagli del nuovo listino e come impatterà i carichi di lavoro in produzione:
Fasce Orarie (Peak vs Off-Peak)
- Ore di punta (Peak):
01:00 – 04:00 UTCe06:00 – 10:00 UTC(coincide con la tarda mattinata europea e la giornata lavorativa asiatica). - Ore non di punta (Off-Peak):Tutte le altre finestre orarie (la tariffa è esattamente dimezzata rispetto al picco).
Tabella Prezzi Ufficiali (per 1M di token)
| Modello e Fascia | Input Cached | Input Uncached | Output |
| V3 (Off-Peak) | $0.007 | $0.007 | $0.28 |
| V3 (Peak) | $0.014 | $0.014 | $0.56 |
| V4 Flash (Off-Peak) | $0.007 | $0.22 | $0.66 |
| V4 Flash (Peak) | $0.014 | $0.44 | $1.32 |
| V4 Pro (Off-Peak) | $0.022 | $0.66 | $1.98 |
| V4 Pro (Peak) | $0.044 | $1.32 | $3.96 |
Le 3 lezioni chiave per sviluppatori e aziende:
- La cache di contesto è obbligatoria: Un cache miss costa sensibilmente di più; ottimizzare prompt di sistema e pipeline RAG permette di abbattere i costi di input fino all’80%.
- Scheduling dei task asincroni:Batch processing, embeddings notturni e pipeline di indicizzazione vanno spostati programmaticamente nelle finestre Off-Peak per risparmiare il 50% netto.
- Fine della guerra al ribasso:Sebbene DeepSeek resti altamente competitivo rispetto ai corrispettivi occidentali, l’infrastruttura AI richiede sostenibilità economica e gestione attiva del traffico.
A questo link ho predisposto un visualizzatore di prezzo, in base all’ora corrente del browser.