Combat au couteau en Chine : le nouveau modèle de DeepSeek est 100 fois moins cher que le produit phare d'Anthropic Le prix de l'intelligence artificielle vient d'atteindre un nouveau plus bas. Le V4-Flash de DeepSeek, officiellement publié vendredi, coûte environ trois cents à exécuter…
Le prix de l’intelligence artificielle vient d’atteindre un nouveau plus bas. Le V4-Flash de DeepSeek, officiellement lancé vendredi, coûte environ trois cents pour exécuter une batterie standard de tests de référence, selon la société de recherche Artificial Analysis de San Francisco. Le Kimi K3 de Moonshot AI coûte 86 cents ; GPT-5.6 Sol d’OpenAI, 1,86 $ ; et Claude Fable 5 d’Anthropic, le modèle le plus performant de l’industrie, 3,15 $. En termes concrets, le modèle chinois est plus de 100 fois moins cher à exploiter que le produit phare américain, selon Reuters.
Le V4-Flash est le modèle le moins cher au monde, et de loin. Le chiffre est encore plus frappant en raison d’un détail enfoui dans le texte de l’entreprise : V4-Flash est inhabituellement verbeux. Il consomme beaucoup de jetons et atterrit toujours à trois cents. Le prix par jeton fait tout le travail.
La même entreprise fournit la mise en garde. V4-Flash obtient un score de 50 sur 100 à l’indice d’intelligence analytique artificielle, un composé de neuf critères couvrant le codage, le raisonnement et les tâches sur le lieu de travail. Cela lie le Gemini 3.6 Flash de Google et le place à un point derrière Muse Spark 1.1 de Meta et GLM-5.2 de Zhipu. Kimi K3 de Moonshot obtient un score de 57, tandis que Claude Opus 5 et Fable 5 d’Anthropic, ainsi que GPT-5.6 d’OpenAI, obtiennent un score d’au moins neuf points de plus.
Cela dit, le V4-Flash donne un coup de pied énorme aux tâches de routine, mais les modèles frontaliers possèdent toujours le gros du travail. Dans un travail agentique difficile et en plusieurs étapes, de petits écarts de fiabilité à chaque étape se traduisent par d’énormes différences de bout en bout. Voilà essentiellement l’état actuel des choses en matière de prix frontière. Mais pour le volume de routine qui représente la majeure partie du trafic de production – synthèse, code passe-partout et automatisation du back-office – V4-Flash est la solution idéale.
Le tirage à 3 cents du V4-Flash est le quatrième tir en 18 jours : les laboratoires d’IA chinois se coupent les uns les autres pour obtenir des parts de marché nationales, et les conséquences sont une réévaluation du marché des modèles partout ailleurs. Le 16 juillet, Moonshot a expédié Kimi K3, un modèle de 2,8 billions de paramètres qui a rapidement pris la première place dans le classement Frontend Code d’Arena, parmi Fable 5 et GPT-5.6 Sol. Le 19 juillet, Alibaba a présenté en avant-première un aperçu de Qwen3.8-Max sur la scène de la Conférence mondiale sur l’IA à Shanghai. Il n’y avait pas de prix, pas de modèle de carte, et sa prétention de se classer « deuxième derrière Fable 5 » reposait sur les évaluations internes d’Alibaba.
Le 27 juillet, Moonshot a répondu en open-source les poids complets de K3, la plus grande version de poids ouvert de l’histoire. DeepSeek a expédié le V4-Flash le 31 juillet. Puis le 3 août – lundi, le même matin où l’article de Reuters a été publié – Alibaba a mis Qwen3.8-Max en disponibilité générale : 2 400 milliards de paramètres au total, 95 milliards de paramètres actifs, une fenêtre contextuelle d’un million de jetons et un prix forfaitaire de 2 $ par million de jetons d’entrée et 6 $ par million de jetons de sortie, sans supplément de contexte long.
La sortie de Qwen a rapidement atterri au n°4 du Frontend Code Arena avec 1 668 points – un point derrière Claude Opus 5 à effort élevé, huit derrière Kimi K3 et devant Fable 5 à 1 630 et GPT-5.6 Sol à 1 620. Parmi les cinq modèles qu’Arena identifie sur la frontière Pareto coût-performance, quatre sont chinois : Kimi K3, Qwen3.8-Max, GLM-5.2 et V4-Flash. La seule entrée américaine, Opus 5, occupe la pointe chère, défendue par 37 points Elo.
Qwen3.8-Max de @Alibaba_Qwen a remodelé la frontière de Pareto coût-performance dans Frontend Code Arena, avec un prix de 2 $ par MToken d’entrée et de 6 $ par MToken de sortie.
Félicitations… https://t.co/3S4tW1KmlI pic.twitter.com/CiWU7Hh4BD
Le propre tableau de référence d’Alibaba est plus franc. Qwen3.8-Max devance Fable 5 et Opus 4.8 sur Terminal-Bench, de 86,6 à 84,6, tout en étant très en retard en matière d’ingénierie de référentiel dur : il obtient un score de 67,7 sur SWE-bench Pro contre 80,0 pour Fable 5. Le fossé du codage selon les préférences a disparu. Le fossé de l’ingénierie profonde reste intact – pour l’instant.
Tout cela soulève une question plus fondamentale : qui paie pour une déduction à trois cents ?
Jusqu’à ce printemps, DeepSeek n’avait jamais pris d’argent extérieur. Le fondateur Liang Wenfeng a financé l’entreprise via son fonds quantitatif, High-Flyer. Fin mai, DeepSeek a clôturé son premier tour de table externe – plus de 50 milliards de yuans, soit environ 7,4 milliards de dollars, pour une valorisation supérieure à 50 milliards de dollars – comme l’a rapporté pour la première fois The Information.
La structure de la ronde est inhabituelle. Des investisseurs commerciaux, apparemment dirigés par Tencent et CATL, ont adhéré à une société en commandite contrôlée par Liang, sans droit de vote et avec une période de blocage de cinq ans. Exactement un parti a reçu des capitaux propres directs et un vote : le Fonds national d’investissement dans l’industrie de l’IA, soutenu par l’État chinois. En quelques semaines, DeepSeek était en pourparlers pour un cycle de suivi d’un montant d’environ 71 milliards de dollars, les bénéfices étant destinés aux centres de données et aux puces.
Ajoutez à cela la réduction API de 75 % que l’entreprise a rendue permanente plus tôt cette année, et l’accord commence à ressembler à une politique industrielle menée via une API : un capital privilégié par l’État souscrivant des jetons à un prix inférieur au coût pour capturer une part mondiale. Cela fonctionne : en juin, DeepSeek représentait près de 23 % des dizaines de milliards de jetons circulant via la passerelle d’IA d’entreprise de Vercel, contre 32 % pour Anthropic.
Comme nous (et maintenant Wall Street) l’avons noté, l’indice de dépenses en jetons – une moyenne pondérée en fonction de l’utilisation de ce que le marché paie par million de jetons, mélangé à travers les API frontières et les plates-formes à pondération ouverte – a culminé au-dessus de 2,0 en mai après avoir presque doublé depuis son lancement en décembre, et est maintenant en baisse.
Le stratège Andreas Steno Larsen l’a qualifié de celui que tout le monde devrait surveiller, avertissant qu’une faiblesse persistante du prix des jetons mettrait fin aux échanges de mémoire, de matériel et de centres de données pour ce cycle. L’indice a imprimé pour la dernière fois 1,3394, soit environ un tiers en dessous de son plus haut de mai. Bloomberg a signalé ce refinancement début juillet comme une preuve que les fournisseurs d’IA perdaient leur pouvoir de fixation des prix face à des clients de plus en plus sensibles aux coûts ; Le propre commentaire de Silicon Data l’a interprété comme un retour à l’usage vers des modèles à poids ouvert.
[…] La suite de l’article est à lire sur ZeroHedge via le lien ci-dessous.
Traduit automatiquement de l’anglais. Le texte original fait foi.
Source : ZeroHedge — Lire l’article original
