Quelle IA est la plus utilisée en ce moment ? Stats mises à jour chaque jour
En bref
Au 18 septembre 2026 : modèle le plus utilisé, DeepSeek V4.1 Flash (DeepSeek) ; éditeur le plus utilisé, DeepSeek. Chiffres OpenRouter de la veille, mis à jour chaque matin.
- Cette page mesure l'usage réel des modèles d'IA : les tokens qui passent chaque jour par l'API OpenRouter, éditeur par éditeur. Pas un sondage, pas un benchmark, de la consommation constatée.
- Les chiffres, graphes et tableaux se mettent à jour automatiquement tous les matins avec la dernière journée complète.
- Le plus utilisé n'est pas le meilleur : en volume, ce sont les modèles rapides et pas chers (les « flash ») qui raflent la mise, pas les modèles frontière.
- Pour chaque éditeur suivi (OpenAI, Anthropic, Google, DeepSeek, Z.ai, Moonshot, Alibaba) : son classement du jour, son modèle phare, ses prix au million de tokens et pourquoi il monte.
Données OpenRouter du 18 septembre 2026 (dernière journée complète), page mise à jour le 19 septembre 2026. Mesure : tokens traités via l’API OpenRouter, tous fournisseurs et toutes variantes confondus.
Bon, la question revient tout le temps, chez mes clients comme dans mes propres projets : « C’est laquelle, l’IA la plus utilisée en ce moment ? ». Et à chaque fois, on se retrouve avec des réponses au doigt mouillé, des classements de benchmarks (qui mesurent la performance, pas l’usage) ou des études de trafic sur les applis grand public. Rien qui dise ce que les gens consomment réellement quand ils branchent une IA dans un outil, un site ou un agent.
Je vais ici tenter une autre approche, purement mécanique : prendre les tokens réellement traités chaque jour par OpenRouter, la plateforme qui donne accès à plus de 400 modèles via une seule API, et les faire parler. C’est une source biaisée (on y reviendra, je vous cache rien), mais c’est de la donnée d’usage, fraîche, et surtout comparable d’un éditeur à l’autre. Comme à mon habitude, je vais essayer de vulgariser au maximum : si le mot « token » vous échappe encore, disons que c’est l’unité de facturation des IA, en gros trois quarts de mot en anglais, un peu moins en français.
Le principe de la page est simple : un robot récupère les chiffres tous les matins, redessine les graphes, recalcule les tableaux, et je ne touche à rien. Les textes d’analyse par éditeur, eux, ne bougent que lorsque le modèle phare change. Vous avez donc sous les yeux la photo de la dernière journée complète, pas un article figé qui date de six mois.
Quelle IA est la plus utilisée aujourd'hui, tous éditeurs confondus ?
Le 18 septembre 2026, 19,52 billions de tokens ont transité par OpenRouter. Le modèle le plus utilisé est DeepSeek V4.1 Flash (DeepSeek) avec 2,62 billions de tokens, soit 13,4 % du total. L’éditeur le plus utilisé est DeepSeek (27,9 % des tokens, tous modèles confondus).
DeepSeek V4.1 Flash est un modèle sparse mixture-of-experts, premier représentant de la nouvelle architecture Causal Encoder-Decoder (CED) de DeepSeek. Il active seulement 8 milliards de paramètres en entrée et 16 milliards en sortie, ce qui lui permet d’être rapide et économique tout en restant pertinent sur du code, du raisonnement et des tâches agentiques longues. Son contexte grimpe à 1 048 576 tokens, avec un prix très compétitif de 0,15 $ en entrée et 0,60 $ en sortie par million de tokens.
Ce qui explique sa position de premier modèle tous éditeurs confondus sur OpenRouter au 16 septembre 2026, c’est la combinaison d’un contexte gigantesque, d’un tarif cassé et d’une architecture inédite qui a fait beaucoup parler depuis sa sortie début septembre. L’adoption a été très rapide chez les développeurs, notamment pour les usages agentiques à fort volume de tokens. Il faut toutefois rester nuancé : difficile de savoir s’il s’agit encore d’une phase de rodage post-lancement, et rappelons qu’OpenRouter ne capte qu’une partie de l’usage réel de DeepSeek, largement utilisé aussi en direct via son API ou en self-hosting.
Top 10 des modèles IA les plus utilisés
Classement détaillé : tokens, part de marché et prix
| # | Modèle | Éditeur | Tokens / jour | Part | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | DeepSeek V4.1 Flash | DeepSeek | 2,62 T | 13,4 % | 0,15 / 0,60 | 39,5 | — | — |
| 2 | Hy4 preview | Tencent | 2,03 T | 10,4 % | 0,83 / 2,50 | — | — | — |
| 3 | GLM 5.3 Flash | Z.ai (GLM) | 1,94 T | 10,0 % | 0,09 / 0,30 | 41,9 | 71,5 | 51,2 |
| 4 | DeepSeek V4 Flash 0731 | DeepSeek | 1,93 T | 9,9 % | 0,07 / 0,18 | 34,5 | 69,1 | 41,7 |
| 5 | GPT-5.6 Luna | OpenAI | 1,19 T | 6,1 % | 0,20 / 1,20 | 37,5 | 71,4 | 42,7 |
| 6 | MiMo-V2.5 | Xiaomi | 940 Md | 4,8 % | 0,14 / 0,28 | 22,3 | 56,8 | 17,4 |
| 7 | Nemotron 3 Ultra | NVIDIA | 810 Md | 4,2 % | 0,60 / 2,40 | 23,4 | 49,3 | 21,7 |
| 8 | Hy3 | Tencent | 728 Md | 3,7 % | 0,13 / 0,53 | — | — | — |
| 9 | GLM 5.3 | Z.ai (GLM) | 588 Md | 3,0 % | 0,91 / 2,86 | 44,9 | 74,8 | 53,4 |
| 10 | DeepSeek V4 Flash 0423 | DeepSeek | 491 Md | 2,5 % | 0,05 / 0,10 | 24,8 | 52,0 | 27,9 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Top 10 des éditeurs IA par volume de tokens
Comment lire ces chiffres sans leur faire dire n'importe quoi ?
Avant de vous jeter sur les classements, quelques précautions, parce que ces courbes sont trompeuses si on les lit trop vite. Un token n’est pas un utilisateur. Un seul agent de code qui tourne toute la nuit peut consommer plus qu’un millier de personnes qui posent trois questions dans un chat. Le volume mesure une intensité d’usage, pas une popularité.
- OpenRouter, c'est le monde des développeurs et des produits qui appellent une API. Les usages grand public (l'appli ChatGPT, Gemini dans Android, Claude sur le web) n'y passent pas. Anthropic et OpenAI sont donc largement sous-estimés ici par rapport à leur usage réel via leurs API directes ou les clouds (Bedrock, Vertex, Azure).
- Les modèles pas chers gonflent mécaniquement les volumes : à 0,05 $ le million de tokens, on laisse tourner sans compter. À 25 $ le million en sortie, on réfléchit à deux fois. C'est pour ça que les « flash » dominent.
- Je regroupe les variantes (standard, batch, gratuite) d'un même modèle et je classe par éditeur, c'est-à-dire par celui qui a entraîné le modèle, pas par celui qui l'héberge. Les pages « provider » d'OpenRouter, elles, comptent par hébergeur : c'est une autre lecture, souvent trompeuse (Alibaba Cloud y sert par exemple les modèles GLM de Z.ai).
- Les données sont celles de la dernière journée complète (J-1). Le jour en cours est partiel, donc jamais affiché.
Ce qu’il faut retenir, c’est que ces chiffres répondent à une question précise : quels modèles les développeurs choisissent-ils réellement quand ils paient au token ? C’est un signal très utile pour choisir un modèle dans un projet, beaucoup moins pour savoir qui « gagne la course à l’IA ».
DeepSeek : quel modèle est le plus utilisé ?
DeepSeek est le 1er éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 5,44 billions de tokens (27,9 % du total). Son modèle phare du moment est DeepSeek V4.1 Flash : 2,62 billions de tokens, 1er modèle tous éditeurs confondus, facturé 0,15 $ par million de tokens en entrée et 0,60 $ en sortie, contexte de 1 048 576 tokens.
DeepSeek V4.1 Flash est un modèle MoE bâti sur une nouvelle architecture Causal Encoder-Decoder : il active 8 milliards de paramètres en entrée et 16 milliards en sortie depuis un socle de 552 milliards de paramètres. Il est adapté aux agents de code, de terminal et d’usage d’ordinateur, ainsi qu’aux tâches longues et à l’analyse de contexte étendu. Comptez 0,15 $ par million de tokens en entrée et 0,60 $ en sortie, pour un contexte de 1 048 576 tokens. Sorti il y a une semaine seulement, ce modèle surfe sur un positionnement prix très agressif et une promesse d’efficacité pour les workflows agentiques : le compressed KV caching réduit la mémoire cache à environ un quart de la génération Flash précédente, ce qui limite fortement les coûts. DeepSeek annonce aussi des résultats de benchmarks devançant ses modèles phares, dont DeepSeek-V4-Pro. Sa domination sur OpenRouter (25,2 % des tokens de l’éditeur) reste toutefois à nuancer : la plateforme ne capte qu’une partie de l’usage réel, l’essentiel du trafic DeepSeek transitant probablement par l’API officielle ou des déploiements directs.
| # | Modèle | Tokens / jour | Part chez DeepSeek | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | DeepSeek V4.1 Flash | 2,62 T | 48,2 % | 1er | 0,15 / 0,60 | 39,5 | — | — |
| 2 | DeepSeek V4 Flash 0731 | 1,93 T | 35,5 % | 4e | 0,07 / 0,18 | 34,5 | 69,1 | 41,7 |
| 3 | DeepSeek V4 Flash 0423 | 491 Md | 9,0 % | 10e | 0,05 / 0,10 | 24,8 | 52,0 | 27,9 |
| 4 | DeepSeek V4 Pro 0813 | 153 Md | 2,8 % | 23e | 0,58 / 1,73 | 36,3 | 68,8 | 42,3 |
| 5 | DeepSeek V4 Pro 0423 | 139 Md | 2,6 % | 24e | 0,59 / 1,19 | 30,9 | 59,4 | 27,7 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
OpenAI : quel modèle GPT est le plus utilisé ?
OpenAI est le 4e éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 2,25 billions de tokens (11,5 % du total). Son modèle phare du moment est GPT-5.6 Luna : 1,19 billions de tokens, 5e modèle tous éditeurs confondus, facturé 0,20 $ par million de tokens en entrée et 1,20 $ en sortie, contexte de 1 050 000 tokens.
Chez OpenAI, ce n’est pas le modèle le plus puissant qui domine, c’est GPT-5.6 Luna, le modèle rapide et économique de la série 5.6 sorti en juillet 2026. Il est conçu pour les usages à fort volume et faible latence : chat, classification, workflows agentiques légers, avec un raisonnement correct pour son étage de prix (environ 0,20 $ le million de tokens en entrée, 1,20 $ en sortie) et un contexte d’un million de tokens.
Pourquoi il est tendance ? Parce qu’il coche la case « assez bon et pas cher » avec la fiabilité d’appel d’outils d’OpenAI, ce qui en fait le moteur par défaut de beaucoup de produits SaaS. Les versions plus lourdes (Sol, Terra, et le tout récent GPT-6 Astra sorti début septembre) pèsent bien moins en volume : on les réserve aux tâches qui le méritent. Vous l’aurez compris, chez OpenAI comme ailleurs, c’est l’entrée de gamme qui fait le volume.
| # | Modèle | Tokens / jour | Part chez OpenAI | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Luna | 1,19 T | 52,8 % | 5e | 0,20 / 1,20 | 37,5 | 71,4 | 42,7 |
| 2 | GPT-5.6 Sol | 347 Md | 15,4 % | 11e | 2,00 / 10,00 | 47,1 | 77,4 | 50,5 |
| 3 | GPT-6 Astra | 243 Md | 10,8 % | 15e | 10,00 / 50,00 | 52,8 | 76,9 | 51,5 |
| 4 | GPT-5.6 Terra | 87 Md | 3,9 % | 31e | 2,00 / 12,00 | 42,3 | 76,7 | 43,7 |
| 5 | gpt-oss-120b | 67 Md | 3,0 % | 39e | 0,15 / 0,60 | 12,3 | 30,4 | 6,2 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Z.ai (GLM) : quel modèle est le plus utilisé ?
Z.ai (GLM) est le 2e éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 2,81 billions de tokens (14,4 % du total). Son modèle phare du moment est GLM 5.3 Flash : 1,94 billions de tokens, 3e modèle tous éditeurs confondus, facturé 0,09 $ par million de tokens en entrée et 0,30 $ en sortie, contexte de 1 310 720 tokens.
Z.ai (l’ex-Zhipu AI, éditeur de la famille GLM) place en tête GLM 5.3 Flash, un modèle multimodal natif sorti fin août 2026, conçu pour le code efficace et les agents qui travaillent longtemps sur une même tâche. Son architecture d’attention hybride (une partie « sparse », une partie linéaire) lui permet de rester précis sur des contextes très longs sans exploser les coûts.
Il est tendance pour une raison simple : à environ 0,07 $ le million de tokens en entrée et 0,25 $ en sortie, il joue dans la même cour que DeepSeek V4 Flash, avec la multimodalité en plus. Les développeurs qui font tourner des agents de code à la chaîne y trouvent un moteur bon marché. Petite subtilité pour lire les chiffres d’OpenRouter : GLM est souvent servi par des hébergeurs tiers, dont Alibaba Cloud, d’où le fait qu’il apparaisse sur la page « provider » d’Alibaba alors que ce n’est pas un modèle Alibaba.
| # | Modèle | Tokens / jour | Part chez Z.ai (GLM) | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | GLM 5.3 Flash | 1,94 T | 69,3 % | 3e | 0,09 / 0,30 | 41,9 | 71,5 | 51,2 |
| 2 | GLM 5.3 | 588 Md | 21,0 % | 9e | 0,91 / 2,86 | 44,9 | 74,8 | 53,4 |
| 3 | GLM 5.2 | 243 Md | 8,7 % | 14e | 0,55 / 1,74 | 34,0 | 68,8 | 39,4 |
| 4 | GLM 5.1 | 10 Md | 0,4 % | 84e | 0,97 / 3,04 | 26,4 | 55,8 | 25,2 |
| 5 | GLM 4.7 | 6,6 Md | 0,2 % | 103e | 0,40 / 1,75 | — | 45,3 | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Google : quel modèle Gemini est le plus utilisé ?
Google est le 5e éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 991 milliards de tokens (5,1 % du total). Son modèle phare du moment est Gemini 3.8 Flash : 272 milliards de tokens, 13e modèle tous éditeurs confondus, facturé 0,75 $ par million de tokens en entrée et 3,75 $ en sortie, contexte de 1 048 576 tokens.
Chez Google, le modèle phare du moment est Gemini 3.8 Flash, sorti le 2 septembre 2026. Google le présente comme son Flash le plus intelligent, avec des gains notables sur l’ingénierie logicielle, les tâches agentiques et le raisonnement multi-étapes. Contexte d’un million de tokens, multimodal, et un tarif intermédiaire : environ 0,75 $ le million de tokens en entrée, 3,75 $ en sortie.
Pourquoi il monte ? Parce que c’est tout neuf, tout simplement : à chaque nouvelle version Flash, les développeurs migrent en quelques jours, ce qui explique que la version précédente (3.7 Flash) décroche aussi vite. Google joue la carte du « bon partout, pas cher, gros contexte », très efficace en volume. À noter que l’usage de Gemini via Google AI Studio ou Vertex directement n’apparaît pas ici : la part réelle de Google est donc plus élevée que ce que montre OpenRouter.
| # | Modèle | Tokens / jour | Part chez Google | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.8 Flash | 272 Md | 27,5 % | 13e | 0,75 / 3,75 | 41,2 | 76,3 | 41,1 |
| 2 | Gemini 3 Flash Preview | 124 Md | 12,5 % | 25e | 0,50 / 3,00 | — | — | — |
| 3 | Gemini 2.5 Flash Lite | 92 Md | 9,3 % | 29e | 0,10 / 0,40 | — | — | — |
| 4 | Gemini 3.7 Flash | 87 Md | 8,8 % | 32e | 0,75 / 3,75 | 39,4 | 76,1 | 36,4 |
| 5 | Gemini 3.1 Flash Lite | 78 Md | 7,9 % | 35e | 0,25 / 1,50 | — | — | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Anthropic : quel modèle Claude est le plus utilisé ?
Anthropic est le 8e éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 704 milliards de tokens (3,6 % du total). Son modèle phare du moment est Claude Sonnet 5 : 238 milliards de tokens, 17e modèle tous éditeurs confondus, facturé 2,00 $ par million de tokens en entrée et 10,00 $ en sortie, contexte de 1 000 000 tokens.
Claude Sonnet 5 est le nouveau modèle « Sonnet » d’Anthropic, pensé pour le code, les agents autonomes et le travail professionnel. Il peut établir des plans, utiliser des outils comme des navigateurs et des terminaux, et fonctionner de manière autonome à un niveau qui nécessitait il y a peu des modèles plus grands et plus coûteux. Il est facturé 2,00 $ par million de tokens en entrée et 10,00 $ en sortie, pour une fenêtre de contexte allant jusqu’à 1 000 000 de tokens.
Depuis sa sortie fin juin 2026, Claude Sonnet 5 est disponible sur tous les plans et constitue le modèle par défaut des offres Free et Pro, ce qui explique en partie sa forte adoption. Ses performances se rapprochent de celles d’Opus 4.8, mais à des prix inférieurs, un positionnement qui séduit les développeurs. À noter : ce tarif de 2 $/10 $ était initialement présenté comme une offre de lancement, appelée à évoluer vers 3 $ et 15 $ par million de tokens fin août 2026 — un point à surveiller. Rappelons enfin qu’OpenRouter ne capte qu’une fraction de l’usage réel d’Anthropic, largement consommé en direct via l’API Claude et Claude Code.
| # | Modèle | Tokens / jour | Part chez Anthropic | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Sonnet 5 | 238 Md | 33,8 % | 17e | 2,00 / 10,00 | 38,4 | 71,5 | 44,3 |
| 2 | Claude Opus 5 | 183 Md | 26,0 % | 20e | 5,00 / 25,00 | 50,7 | 78,0 | 56,2 |
| 3 | Claude Opus 4.8 | 71 Md | 10,1 % | 37e | 5,00 / 25,00 | 42,0 | 74,3 | 42,6 |
| 4 | Claude Fable 5.1 | 71 Md | 10,1 % | 38e | 10,00 / 50,00 | 53,4 | 81,6 | 58,0 |
| 5 | Claude Sonnet 4.6 | 54 Md | 7,7 % | 45e | 3,00 / 15,00 | 30,5 | 63,0 | 33,1 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Moonshot AI (Kimi) : quel modèle est le plus utilisé ?
Moonshot AI (Kimi) est le 12e éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 276 milliards de tokens (1,4 % du total). Son modèle phare du moment est Kimi K3 : 230 milliards de tokens, 18e modèle tous éditeurs confondus, facturé 2,07 $ par million de tokens en entrée et 11,59 $ en sortie, contexte de 1 048 576 tokens.
Chez Moonshot AI, c’est Kimi K3 qui concentre l’usage : un modèle open-weight géant (2 800 milliards de paramètres, mélange d’experts), multimodal, orienté raisonnement, sorti mi-juillet 2026. Il est particulièrement fort en code complexe, en travail de connaissance et sur les workflows agentiques longs, là où il faut tenir un plan sur des dizaines d’étapes.
Il est tendance parce qu’il incarne l’open-weight « frontière » : des poids ouverts, une qualité comparable aux modèles fermés, et un prix (environ 3 $ le million de tokens en entrée, 15 $ en sortie) qui reste sous celui des Opus et autres GPT-6. Ce n’est pas un modèle de volume comme les « flash », mais un modèle de confiance pour ceux qui veulent du lourd sans dépendre d’un éditeur américain.
| # | Modèle | Tokens / jour | Part chez Moonshot AI (Kimi) | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 | 230 Md | 83,4 % | 18e | 2,07 / 11,59 | 43,8 | 76,2 | 50,6 |
| 2 | Kimi K2.6 | 27 Md | 9,8 % | 62e | 0,95 / 4,00 | 27,5 | 61,8 | 22,1 |
| 3 | Kimi K2.7 Code | 10 Md | 3,7 % | 86e | 0,71 / 3,21 | 26,3 | 60,8 | 22,5 |
| 4 | Kimi K2.5 | 6,9 Md | 2,5 % | 101e | 0,45 / 2,25 | — | 46,8 | — |
| 5 | Kimi K2 0711 | 0,7 Md | 0,2 % | 179e | 0,57 / 2,30 | — | — | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Alibaba (Qwen) : quel modèle est le plus utilisé ?
Alibaba (Qwen) est le 9e éditeur le plus utilisé sur OpenRouter le 18 septembre 2026, avec 388 milliards de tokens (2,0 % du total). Son modèle phare du moment est Qwen3.8 Max (0902) : 88 milliards de tokens, 30e modèle tous éditeurs confondus, facturé 2,00 $ par million de tokens en entrée et 6,00 $ en sortie, contexte de 1 000 000 tokens.
Qwen3.8 Max (0902) est un modèle propriétaire d’Alibaba, une architecture mixture-of-experts pesant 2,4 billions de paramètres, capable d’ingérer du texte, de l’image et de la vidéo pour ne restituer que du texte. Il vise clairement les tâches lourdes : raisonnement complexe, analyse multimodale et traitement de très longs documents grâce à son contexte d’1 000 000 de tokens. Comptez 2,00 $ par million de tokens en entrée et 6,00 $ en sortie, un positionnement qui reste dans la fourchette haute des modèles frontière.
Cette version 0902 est un snapshot mis à jour, pas une preview, mais son adoption reste encore modeste sur OpenRouter : 88 milliards de tokens sur la journée, soit 0,5 % du trafic total et seulement la 30e place tous éditeurs confondus. Elle devient malgré tout le modèle le plus utilisé de Qwen sur la plateforme, ce qui traduit un intérêt croissant pour le contexte géant et le multimodal natif. À noter, comme souvent avec Alibaba : une bonne partie de l’usage réel passe par des canaux propriétaires ou domestiques chinois, invisibles ici.
| # | Modèle | Tokens / jour | Part chez Alibaba (Qwen) | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 Max (0902) | 88 Md | 22,7 % | 30e | 2,00 / 6,00 | 45,4 | 76,2 | 56,1 |
| 2 | Qwen3.8 Flash | 65 Md | 16,7 % | 40e | 0,15 / 0,47 | — | — | — |
| 3 | Qwen3.7 Flash | 62 Md | 15,9 % | 41e | 0,03 / 0,13 | — | — | — |
| 4 | Qwen3.8 27B | 46 Md | 11,8 % | 51e | 0,21 / 2,55 | 33,9 | 68,1 | 46,5 |
| 5 | qwen3-embedding-8b | 24 Md | 6,1 % | 63e | — | — | — | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Comment cette page est-elle fabriquée ?
Pour ceux qui aiment savoir ce qu’il y a sous le capot (et parce que je préfère montrer la mécanique plutôt que vous demander de me croire sur parole), voici le pipeline, en gros :
- Chaque matin, un workflow n8n interroge le classement OpenRouter (celui qui alimente la page Rankings) et récupère, modèle par modèle, les tokens traités la veille, toutes variantes confondues.
- Les prix et fiches des modèles viennent de l'API publique d'OpenRouter (celle des modèles), donc les tarifs affichés sont ceux facturés le jour même.
- Le tout est agrégé par modèle puis par éditeur (préfixe du modèle : openai/, anthropic/, google/…), et archivé dans une table pour construire les courbes de tendance jour après jour.
- Les graphes sont dessinés en SVG directement par le workflow, sans outil externe : ils se mettent à jour dans la page et s'ouvrent en grand au clic.
- Les textes d'analyse par éditeur sont régénérés uniquement quand le modèle phare change, avec une recherche web pour comprendre pourquoi. Le reste du temps, seuls les chiffres bougent.
Aucun chiffre n’est retouché à la main. Si un jour une courbe vous paraît bizarre, c’est probablement OpenRouter qui a eu un hoquet, ou un modèle gratuit qui a fait un pic : ça arrive, et je préfère l’afficher que le lisser.
Ce qu'il faut retenir
L’IA la plus utilisée, c’est presque toujours la moins chère qui fait le job. Les modèles frontière font les gros titres, les modèles « flash » font les gros volumes. Si vous choisissez un modèle pour un projet, cette page vous dit où va l’argent des développeurs qui paient au token, et à quel prix. Ce qu’elle ne dit pas, c’est lequel est le meilleur pour votre cas : ça, il faut le tester.
Je fais tourner cette page comme un tableau de bord public, et je compte l’enrichir (part de dépense, et pas seulement de tokens ; évolution sur 90 jours ; peut-être d’autres sources que OpenRouter). Vous en pensez quoi, de cette lecture par les tokens ? Un éditeur que vous voudriez voir suivi ici ? Dites-le moi en commentaire.
Questions fréquentes
Quelle est l'IA la plus utilisée dans le monde ?
Ça dépend de ce qu’on mesure. En nombre d’utilisateurs grand public, ChatGPT reste largement devant. En volume de tokens consommés par les développeurs via une API multi-modèles comme OpenRouter, la tête du classement change presque chaque semaine : les modèles économiques (DeepSeek V4 Flash, GPT-5.6 Luna, GLM 5.3 Flash, Hy4) se disputent la première place. Cette page vous donne le classement de la veille, mis à jour chaque jour.
Pourquoi utiliser OpenRouter comme source et pas les éditeurs eux-mêmes ?
Parce que les éditeurs ne publient pas leurs volumes, et que quand ils le font, ce n’est pas comparable. OpenRouter est le seul endroit où plus de 400 modèles de tous les éditeurs sont consommés au même endroit, mesurés de la même façon et publiés ouvertement. C’est un échantillon biaisé (développeurs, API, sensibilité au prix), mais c’est un échantillon honnête.
Un token, c'est quoi exactement ?
C’est l’unité de découpage du texte par un modèle de langue, et donc l’unité de facturation. En pratique, un token vaut à peu près trois quarts d’un mot en anglais, un peu moins en français (nos accents et nos mots longs coûtent plus cher). Mille milliards de tokens, c’est environ l’équivalent de plusieurs millions de livres traités dans la journée.
Le modèle le plus utilisé est-il le meilleur ?
Non, et c’est même souvent l’inverse. Les modèles les plus consommés sont ceux qui offrent le meilleur rapport qualité/prix pour des tâches répétitives : extraction, classification, agents de code. Les modèles les plus performants sur les benchmarks (Claude Opus, GPT-6, Gemini Pro) sont plus chers, donc utilisés avec parcimonie, sur les tâches qui le méritent.
À quelle fréquence les chiffres sont-ils mis à jour ?
Tous les matins, avec les données de la dernière journée complète (J-1). Les courbes de tendance se construisent au fil des jours de collecte, et les textes d’analyse par éditeur sont réécrits automatiquement quand le modèle phare change.
Vous voulez mesurer votre propre visibilité dans les réponses des IA, ou brancher ce type de tableau de bord sur vos données ? On en parle.







Laisser un commentaire
Rejoindre la discussion?N’hésitez pas à contribuer !