Le modèle Viral Sensation Ox Alpha révélé sous le nom de GLM-5.3-Flash, fonctionnant entièrement sur des puces chinoises. La société chinoise Z.AI (Zhipu) a confirmé qu'elle était responsable du modèle viral – et mystérieux – Ox Alpha AI qui s'est hissé au sommet des tableaux d'utilisation en ligne…
La société chinoise Z.AI (Zhipu) a confirmé qu’elle est responsable du modèle viral – et mystérieux – Ox Alpha AI qui s’est hissé au sommet des classements d’utilisation en ligne ce week-end, faisant grimper ses actions jusqu’à 12 % jeudi. La société basée à Pékin a annoncé son intention de fixer le prix de l’utilisation du modèle, désormais appelé GLM-5.3-Flash, à 0,15 $ par million de jetons d’entrée et à 0,50 $ par million de jetons de sortie, ou unités de travail d’intelligence artificielle. Cela le place aux côtés de DeepSeek dans la classe des modèles à faible coût et à très haute efficacité qui éloignent les utilisateurs des offres haut de gamme comme Anthropic PBC.
Dans le cadre de cette révélation, Zhipu AI a lancé son dernier modèle à poids ouvert, GLM-5.3-Flash, f/k/a Ox Alpha, affirmant que le système fonctionnait entièrement sur un cluster de 100 000 puces produites dans le pays lors d’un essai furtif de grande envergure.
En d’autres termes, non seulement la Chine domine le modèle open-weight, mais elle dominera bientôt le matériel utilisé pour le faire fonctionner, exactement comme nous l’avions prévenu il y a une semaine.
Avec la hausse des prix des jetons de modèle ouvert, on peut deviner ce qui se passe chez Anthropic et ChatGPT.
Que se passe-t-il lorsque la Chine inonde le monde de puces Ascend bon marché pour alimenter les modèles ouverts chinois https://t.co/8u0zDGUgwM pic.twitter.com/NGn3T78UOo
Suite à cette nouvelle, les actions de Zhipu ont clôturé en hausse de plus de 12 % à 1 160 HK$ à Hong Kong jeudi.
« Ce que GLM-5.3-Flash confirme est une tendance qui n’est plus surprenante : les laboratoires chinois expédient des modèles ouverts proches des frontières à une fraction du prix occidental », a déclaré Dermot McGrath, fondateur du cabinet de conseil ZenGen Labs basé à Shanghai.
Cette annonce fait suite à une semaine de trafic intense sur le marché des modèles d’intelligence artificielle OpenRouter et la plateforme d’agents OpenCode, où le modèle a traité 62 000 milliards de jetons avant sa publication officielle mercredi, selon Zhipu.
Sur OpenRouter, le système a traité plus de 23 000 milliards de jetons au cours de ses six premiers jours, ce qui en fait le plus grand lancement de la plateforme à ce jour.
Ox Alpha, comme on l’appelait initialement, est apparu ce week-end sous la forme d’une version non créditée sur OpenRouter – le plus grand lancement de l’histoire de ce marché – et a rapidement gagné du terrain parmi les observateurs et les utilisateurs curieux. Il s’agit d’un modèle de raisonnement conçu pour les tâches de codage et d’agent, et il peut traiter les entrées de texte, d’image et de vidéo, selon sa description. Le modèle n’est pas loin de l’Opus 4.8 d’Anthropic en termes de codage et de capacités agents, a déclaré Z.ai dans un article de blog.
Ce déploiement marque un test important de la capacité de la Chine à gérer des charges de travail d’inférence mondiales à grande échelle sur du matériel local, alors que Pékin cherche à réduire sa dépendance à l’égard des processeurs avancés de Nvidia dans un contexte de contrôles stricts des exportations.
Lors de sa version préliminaire, Ox Alpha s’est rapidement hissé au sommet des classements d’utilisation mondiaux. Selon les données d’OpenRouter publiées jeudi, le modèle se classe au premier rang des systèmes de codage de la plateforme, représentant 10 300 milliards de jetons, soit près de 31 % de son volume hebdomadaire total.
Pour surmonter la capacité de mémoire et la bande passante inférieures des puces chinoises individuelles par rapport aux unités de traitement graphique Nvidia de premier plan, Zhipu – qui opère à l’échelle internationale sous la marque Z.ai – a déclaré avoir construit un moteur d’inférence spécialisé qui divise les étapes de traitement en pools informatiques gérés de manière indépendante.
La société a déclaré que ces ajustements architecturaux ont triplé les performances de service de bout en bout par rapport à leur base de référence initiale, ce qui a amené l’efficacité matérielle et les coûts par jeton à égalité avec les accélérateurs Nvidia traditionnels. Les affirmations doivent encore être vérifiées de manière indépendante.
Bien que Zhipu n’ait pas nommé de fournisseurs de puces spécifiques pour ce cluster, il a déjà collaboré avec les principaux développeurs nationaux de semi-conducteurs, notamment Huawei Technologies, fabricant de la puce Ascend de plus en plus populaire, Cambricon Technologies et Moore Threads.
Cambricon a déclaré jeudi avoir atteint la compatibilité « Jour 0 » pour servir GLM-5.3-Flash. Moore Threads a déclaré avoir également atteint le support « Jour 0 » pour le nouveau modèle.
Doté d’un total de 320 milliards de paramètres, GLM-5.3-Flash n’en active que 18 milliards par requête pour réduire la charge de calcul, selon Zhipu. Il s’agit également du premier modèle de la série GLM-5 à traiter nativement les informations visuelles parallèlement au texte.
La société d’analyse comparative Artificial Analysis a attribué au modèle un score de 57 sur son indice d’intelligence, le plaçant au 10e rang mondial et au troisième rang parmi les modèles à poids ouvert, derrière le Kimi K3 de Moonshot AI et le Qwen3.8 2.4T A95B d’Alibaba Group Holding.
Zhipu vante des prix agressifs pour convaincre les développeurs internationaux, proposant le GLM-5.3-Flash à 1/10ème du tarif du GLM-5.3 standard – chutant à 1/20ème dans le cadre d’une promotion limitée. Il a affirmé que le nouveau modèle coûtait environ 1/40ème du prix de l’Opus 4.8 d’Anthropic à des niveaux d’intelligence comparables.
[…] La suite de l’article est à lire sur ZeroHedge via le lien ci-dessous.
Traduit automatiquement de l’anglais. Le texte original fait foi.
Source : ZeroHedge — Lire l’article original
