Un modèle phare quitte son étiquette d'aperçu
DeepSeek a fait passer son modèle phare V4 Pro de l'aperçu à la disponibilité générale le 12 août 2026, clôturant une phase de test qui durait depuis le 24 avril. La version porte l'étiquette 0813 et suit la variante plus petite, V4-Flash, qui avait franchi la même étape vers un statut officiel dès le 31 juillet. Les deux modèles résident désormais dans l'API de production de DeepSeek et non plus dans un niveau d'aperçu où les développeurs avaient été prévenus de changements possibles sans préavis.
V4 Pro conserve la fenêtre de contexte d'un million de jetons qu'il avait déjà en aperçu, avec une sortie maximale de 384 000 jetons par requête. DeepSeek a construit le modèle comme un système à mélange d'experts avec 1,6 billion de paramètres au total, dont 49 milliards s'activent pour chaque jeton individuel, le même schéma d'architecture que l'entreprise utilise depuis V3 pour maintenir des coûts de service bas tout en augmentant la capacité totale.
Le calcul d'efficacité derrière 1,6 billion de paramètres
Le chiffre qui fait la une n'est pas le nombre de paramètres, mais la manière dont DeepSeek parvient à les servir à bas coût. Un nouveau mécanisme d'attention que l'entreprise appelle Compressed Sparse Attention, associé à ce qu'elle nomme Heavily Compressed Attention, réduit le calcul nécessaire par jeton d'inférence à 27 pour cent de ce qu'exigeait le modèle précédent V3.2, et réduit le cache clé-valeur, gourmand en mémoire, à 10 pour cent de son empreinte antérieure.
Sur les tests de référence, V4 Pro résout 80,6 pour cent des tâches de SWE-bench Verified, à égalité avec Gemini-3.1-Pro de Google sur le même test, et obtient un taux de réussite de 90,1 pour cent sur GPQA Diamond et de 93,5 pour cent sur LiveCodeBench. Il reste derrière GPT-5.4 d'OpenAI sur Terminal Bench 2.0, avec 67,9 contre 75,1, et affiche une note Codeforces de 3 206, preuve que DeepSeek est désormais mesurée face aux laboratoires américains de tête, et non plus à côté d'eux.
98 pour cent moins cher, et plus pour longtemps
À sa disponibilité générale, V4 Pro est facturé 0,435 dollar par million de jetons en entrée en cas de cache manqué, 0,003625 dollar par million en cas de cache réussi, et 0,87 dollar par million de jetons en sortie, un tarif inchangé depuis l'aperçu. Le niveau moins cher, V4-Flash, coûte 0,14 dollar par million de jetons en entrée et 0,28 dollar pour la sortie. Le cabinet Artificial Analysis a mesuré le coût effectif de V4-Flash à environ 0,03 dollar par tâche de référence, contre 1,86 dollar pour le GPT-5.6 Sol d'OpenAI et 3,15 dollars pour le Claude Fable 5 d'Anthropic, un écart de plus de 98 pour cent.
Dans la même fenêtre que le lancement de V4 Pro, la page de documentation pour développeurs de DeepSeek portait un avis distinct: le prix global de l'API va augmenter significativement dans un avenir proche, même si l'entreprise n'a donné ni date ni pourcentage. Les développeurs ont été invités à planifier leur usage en conséquence, la structure tarifaire définitive devant être annoncée séparément, un aveu inhabituel que le tarif d'aujourd'hui n'est pas celui sur lequel les clients devraient bâtir leur budget.
Le poste de dépense qui vient de devenir variable
Le moment compte plus que le chiffre. DeepSeek prévient d'un repricing dans le même cycle de sortie qui vient de donner à V4 Pro son statut de production, ce qui signale aux équipes d'achat que la fiabilité du modèle a mûri avant son coût. Une limite de 500 requêtes simultanées sur le point d'accès Pro, un cinquième du plafond de 2 500 du niveau Flash moins cher, est un second signal dans le même sens: la capacité du niveau plus cher et de meilleure qualité est la contrainte que DeepSeek gère en priorité, et le prix est le levier qui lui reste.
Les entreprises qui ont déplacé des charges de travail vers les modèles chinois précisément pour échapper à l'imprévisibilité des prix américains de pointe portent désormais la même exposition dans l'autre sens, sans plancher ni date au calendrier. À titre d'illustration seulement, pas une prévision: pour une PME parisienne qui budgète en euros, une hausse d'environ 0,80 à 1,38 euro par million de jetons en sortie sur une charge de travail de plusieurs milliards de jetons par mois transformerait une erreur d'arrondi en une variation annuelle à six chiffres, et DeepSeek n'a donné aucune garantie que la hausse s'arrêtera là. Traiter un tarif subventionné comme un poste fixe dans un budget pluriannuel a toujours été un pari sur le fait qu'un marché à prix cassé resterait stable; le fournisseur vient de dire, dans sa propre documentation, qu'il n'en sera rien.
À lire ensuite: Le modèle a changé, pas le nom de l'API | Les heures de Pékin fixent votre facture d'IA



