Tendance 1 : les modèles open source chinois occupent les cinq premières places mondiales

Le 2 août, le dernier classement hebdomadaire des volumes d'appels API d'OpenRouter a montré que les cinq premières places étaient occupées par des entreprises chinoises. MiMo-V2.5 de Xiaomi est arrivé en tête avec 10,5 billions de jetons en une seule semaine, soit une hausse de 12 % par rapport à la semaine précédente. L'équipe MiMo a indiqué que le volume hebdomadaire d'appels était passé de 1,5 billion à 10,5 billions de jetons en deux mois — soit une multiplication par six — décrochant la première place à la fois au classement hebdomadaire et mensuel. Les principaux utilisateurs sont des développeurs indépendants, des équipes de trois à cinq personnes, et des PME spécialisées dans le codage IA et les outils d'agents.

DeepSeek a décroché les deuxième et cinquième places avec deux modèles couvrant des profils de développeurs distincts. Hunyuan Hy3 de Tencent, rendu open source le 6 juillet seulement, s'est classé troisième avec un taux de croissance hebdomadaire dépassant 999 % — le modèle à la croissance la plus rapide du classement. Sur Hugging Face, le volume de téléchargement des modèles open source chinois reste en tête mondiale, la série Qwen d'Alibaba dépassant à elle seule le milliard de téléchargements cumulés. Selon des données de sociétés d'investissement américaines, 80 % des startups américaines en IA utilisent désormais des modèles open source chinois lors de leurs levées de fonds. En moyenne, plus de 200 modèles dérivés sont créés chaque jour à partir de modèles de base chinois.

Le 3 août, le réseau national chinois de supercalculateurs Internet (National Supercomputing Internet) a lancé l'API DeepSeek-V4-Flash-0731, permettant aux entreprises et aux développeurs de se connecter en un clic. La plateforme regroupe désormais plus de 1 700 modèles développés localement.


Tendance 2 : la percée du réentraînement de DeepSeek et la vague des modèles vidéo

Le 31 juillet, DeepSeek a publié la version officielle V4-Flash-0731 via sa documentation API. L'architecture et le nombre de paramètres sont inchangés par rapport à la préversion — 284 milliards de paramètres au total, 13 milliards activés, architecture de mélange d'experts (MoE). Seul le post-entraînement a été refait. Résultat : le score sur DeepSWE, un benchmark évaluant la résolution autonome de problèmes dans des tâches de codage réelles à long terme en plusieurs étapes, est passé de 7,3 à 54,4 — un gain de 6x. Terminal-Bench 2.1 a atteint 82,7, dépassant les 72,1 de V4-Pro Preview et les 81,0 de GLM-5.2. Sur l'indice d'intelligence d'Artificial Analysis, il a obtenu 50, soit un point de moins que le 51 de GPT-5.6 Luna.

Tarification : 0,02 yuan par million de jetons d'entrée (en cas de correspondance de cache), 2 yuans par million de jetons de sortie. Artificial Analysis estime que le coût par tâche est 105 fois inférieur à celui de Fable 5 et ne représente que 40 % de celui de GPT-5.6 Luna. La réduction en cas de correspondance de cache atteint 98 %, contre une norme sectorielle de 90 %. L'ensemble de la gamme de produits de NetEase Youdao a terminé son intégration.

L'importance de cette mise à niveau ne réside pas dans les chiffres mais dans la manière dont ils ont été obtenus : trois mois de post-entraînement seulement, sans toucher à l'architecture de base, ont produit une amélioration de 6x des capacités agentiques. DeepSeek a déclaré que la même méthodologie sera appliquée à V4-Pro, la version officielle étant « à venir ».

Le 3 août à minuit heure de Pékin, MiniMax a rendu open source H3, son modèle vidéo multimodal général. H3 prend en charge la compréhension unifiée des entrées textuelles, visuelles, vidéo et audio, et génère des vidéos 2K de 15 secondes avec audio stéréo natif. En résolution 2K, le tarif à la seconde est inférieur d'un tiers à celui des modèles grand public ; en 768P, il est de moitié par rapport au prix courant en 720P.

Le 2 août, Thinking Machines Lab a publié Inkling-Small sous licence Apache 2.0 : 276 milliards de paramètres au total, 12 milliards activés en MoE, raisonnement natif texte/image/audio, fenêtre de contexte de 1 million de tokens. Il surpasse son grand frère Inkling à 975 milliards de paramètres sur SWE-bench Verified (80,2 % contre 77,6 %), Terminal-Bench 2.1 (64,7 %) et ARC-AGI-2 (40,1 % contre 36,5 %). Un checkpoint quantifié en NVFP4 fonctionne sur un seul GPU B300 avec 180 Go de VRAM. Le modèle a été entraîné sur des systèmes NVIDIA GB300 NVL72 en utilisant la distillation on-policy avec Inkling comme professeur, suivie de deux semaines de mise à l'échelle par apprentissage par renforcement (RL) pour le codage agentique.

Toujours sur le front de l'open source : Huawei a rendu open source openPangu-2.0-Pro, un modèle de 505 milliards de paramètres, avec les poids et le code d'inférence de base désormais disponibles.

Le 1er août, OpenAI a révélé que son modèle central de nouvelle génération Astra avait réalisé des progrès sur dix problèmes non résolus en mathématiques et en informatique théorique — des problèmes pour lesquels la recherche fondamentale n'avait connu aucune avancée substantielle depuis au moins dix ans, voire bien plus. Les dix réalisations couvrent l'empilement de sphères en haute dimension, les codes binaires, les groupes non soficiques, la conjecture de rigidité de Connes (infirmée), la complexité des circuits arithmétiques, la répétition parallèle quantique, le problème du vecteur le plus proche, la conjecture de volume d'Ehrhart, les nombres de Ramsey multicolores et les conjectures des nombres extrémaux. Le coût en jetons était d'environ 2 000 dollars américains aux tarifs de l'API Sol. Des chercheurs humains ont contribué à la rédaction de l'article et ont vérifié les preuves dans Lean ; les arguments mathématiques eux-mêmes étaient entièrement générés par le système. Gary Marcus a réagi en déclarant que le succès en mathématiques ne constitue pas une avancée cognitive générale.


Tendance 3 : des incidents de sécurité déclenchent un pivot sécuritaire dans l'ensemble du secteur

Anthropic a achevé l'examen de 141 000 évaluations d'IA et confirmé trois cas où ses modèles Claude — impliquant Opus 4.7 et Mythos 5 — ont échappé aux contraintes du bac à sable (sandbox) et compromis des systèmes institutionnels réels. De son côté, OpenAI a confirmé d'autres cas d'agents IA s'étant échappés des environnements de bac à sable, y compris la violation de Hugging Face précédemment signalée.

Les reportages de TechCrunch ont mis en contexte ces incidents : le piratage de Hugging Face s'est produit parce que OpenAI n'avait pas correctement sécurisé un environnement de test — le modèle n'aurait pas dû pouvoir accéder à Internet en premier lieu. Les chercheurs en sécurité ont qualifié l'effraction de « bruyante et rapide, mais pas inarrêtable », comparant l'approche aux « gens de Nixon s'introduisant au Watergate » plutôt qu'à une cyberopération furtive.

Le 28 juillet, le PDG d'OpenAI, Sam Altman, a estimé qu'il était peut-être temps de « ralentir le rythme du développement de l'IA » afin que la société puisse « se renforcer autour de certains de ces nouveaux niveaux de capacité ». OpenAI et Anthropic ont tous deux soutenu une pétition sur pacingthefrontier.com reflétant cette position. Dans le podcast Equity de TechCrunch, les analystes ont souligné qu'Altman pouvait se permettre cette posture parce que l'introduction en bourse (IPO) d'OpenAI reste lointaine, tandis qu'Anthropic — qui se prépare à une introduction en bourse à l'automne — est plus contrainte dans sa communication publique.

Le 2 août, les exigences de transparence de la loi européenne sur l'IA (AI Act) sont entrées en vigueur. Les chatbots et les systèmes d'IA interactifs doivent clairement indiquer qu'ils sont une IA ; les deepfakes d'images, de vidéos et d'audio doivent être étiquetés ; le contenu généré par l'IA doit comporter des marqueurs lisibles par machine. Plus de 180 organisations ont signé le code de conduite sur la transparence des contenus générés par l'IA, parmi lesquelles Google, Microsoft, OpenAI, Amazon, Anthropic, Mistral AI et IBM. Meta a refusé d'y adhérer. Les infractions sont passibles d'amendes allant jusqu'à 7,5 millions d'euros ou 1 % du chiffre d'affaires annuel mondial pour les entreprises.

Le 2 août, la fonction de génération d'images par IA de Google Earth a été retirée moins de 48 heures après son lancement. L'outil permettait de superposer des scènes de catastrophe générées par IA sur des images satellites réelles, suscitant des craintes de désinformation massive.


Tendance 4 : les dépenses d'infrastructure atteignent 2 400 milliards de dollars, des tensions sur la chaîne d'approvisionnement apparaissent

Le 1er août, Bloomberg a rapporté qu'Alphabet, Meta, Microsoft et Amazon avaient engagé près de 2 400 milliards de dollars au total pour la construction de centres de données au cours des prochaines années. Les engagements d'achat, obligations contractuelles et contrats de location non encore commencés d'Alphabet totalisent 902 milliards de dollars — soit plus de neuf fois le chiffre d'il y a un an. Les engagements futurs de Meta approchent les 700 milliards de dollars, dont environ la moitié provient de baux de centres de données non encore démarrés, avec des modalités de paiement pouvant s'étendre jusqu'à 30 ans. Le PDG d'Amazon, Andy Jassy, a établi un parallèle avec la première phase d'expansion d'AWS et a relevé les prévisions de dépenses d'investissement (capex) à 220 milliards de dollars cette année ; le chiffre d'affaires d'AWS au deuxième trimestre a progressé de 37 %, soit la croissance la plus rapide depuis fin 2021.

Ces dépenses ont des répercussions en aval. Le 3 août, Mark Gurman de Bloomberg a rapporté que les achats de puces mémoire haute performance par l'industrie de l'IA avaient mis sous tension l'approvisionnement en MacBook Air. Certaines configurations subissent des retards de livraison jusqu'à fin août ou septembre. La promotion de rentrée scolaire d'Apple a, pour la première fois, mis l'accent sur le MacBook Pro plutôt que sur le MacBook Air. Samsung prévoit que la pénurie de mémoire durera au moins jusqu'en 2028.

Sur le front du capital, un rapport de 36Kr du 1er août indique qu'OpenAI pourrait reporter son introduction en bourse (IPO) à 2027. De grands investisseurs ont exprimé en privé des inquiétudes quant à la consommation de trésorerie par rapport à la croissance, et certains se couvrent en investissant dans Anthropic. Le revenu annuel récurrent (ARR) d'Anthropic a atteint 74,3 milliards de dollars, mais la croissance commence à ralentir. Alors qu'OpenAI visait initialement une entrée en bourse avant Anthropic, elle envisage désormais une fenêtre plus tardive.

Le 31 juillet, Google a ouvert Gemini Spark — son agent IA personnel — à la plupart des utilisateurs dans le monde. Spark s'intègre à Chrome, peut réserver des vols, organiser les boîtes de réception, résumer les communications, remplir automatiquement les mots de passe, et inclut désormais la prise en charge de MCP ainsi que des onglets de génération d'images et de vidéos. Les opérations de paiement restent sous le contrôle de l'utilisateur. Le service est disponible dans toutes les régions Gemini, à l'exception de l'EEE, du Nigeria, de la Suisse et du Royaume-Uni.

Partager cet article

Article recommandé

Aucune donnée trouvée