En bref
Au 29 septembre 2026 : modèle le plus utilisé, Space Bunny Alpha (Modèle furtif (stealth)) ; éditeur le plus utilisé, DeepSeek. Chiffres OpenRouter de la veille, mis à jour chaque matin.
- Cette page mesure l'usage réel des modèles d'IA : les tokens qui passent chaque jour par l'API OpenRouter, éditeur par éditeur. Pas un sondage, pas un benchmark, de la consommation constatée.
- Les chiffres, graphes et tableaux se mettent à jour automatiquement tous les matins avec la dernière journée complète.
- Le plus utilisé n'est pas le meilleur : en volume, ce sont les modèles rapides et pas chers (les « flash ») qui raflent la mise, pas les modèles frontière.
- Pour chaque éditeur suivi (OpenAI, Anthropic, Google, DeepSeek, Z.ai, Moonshot, Alibaba) : son classement du jour, son modèle phare, ses prix au million de tokens et pourquoi il monte.
Données OpenRouter du 29 septembre 2026 (dernière journée complète), page mise à jour le 30 septembre 2026. Mesure : tokens traités via l’API OpenRouter, tous fournisseurs et toutes variantes confondus.
Bon, la question revient tout le temps, chez mes clients comme dans mes propres projets : « C’est laquelle, l’IA la plus utilisée en ce moment ? ». Et à chaque fois, on se retrouve avec des réponses au doigt mouillé, des classements de benchmarks (qui mesurent la performance, pas l’usage) ou des études de trafic sur les applis grand public. Rien qui dise ce que les gens consomment réellement quand ils branchent une IA dans un outil, un site ou un agent.
Je vais ici tenter une autre approche, purement mécanique : prendre les tokens réellement traités chaque jour par OpenRouter, la plateforme qui donne accès à plus de 400 modèles via une seule API, et les faire parler. C’est une source biaisée (on y reviendra, je vous cache rien), mais c’est de la donnée d’usage, fraîche, et surtout comparable d’un éditeur à l’autre. Comme à mon habitude, je vais essayer de vulgariser au maximum : si le mot « token » vous échappe encore, disons que c’est l’unité de facturation des IA, en gros trois quarts de mot en anglais, un peu moins en français.
Le principe de la page est simple : un robot récupère les chiffres tous les matins, redessine les graphes, recalcule les tableaux, et je ne touche à rien. Les textes d’analyse par éditeur, eux, ne bougent que lorsque le modèle phare change. Vous avez donc sous les yeux la photo de la dernière journée complète, pas un article figé qui date de six mois.
Quelle IA est la plus utilisée aujourd'hui, tous éditeurs confondus ?
Le 29 septembre 2026, 24,94 billions de tokens ont transité par OpenRouter. Le modèle le plus utilisé est Space Bunny Alpha (Modèle furtif (stealth)) avec 5,20 billions de tokens, soit 20,9 % du total. L’éditeur le plus utilisé est DeepSeek (22,7 % des tokens, tous modèles confondus).
Space Bunny Alpha est un modèle en « stealth » (éditeur anonyme) proposé sur OpenRouter, taillé pour l’inférence rapide, le code et l’entrée multimodale native, avec un effort de raisonnement ajustable. Son contexte grimpe à 1 000 000 tokens, ce qui permet d’ingérer de très gros repos ou documents. Côté tarif, c’est on ne peut plus simple : 0,00 $ en entrée comme en sortie, donc gratuit pour l’instant, ce qui en fait un candidat évident pour tester ses capacités à grande échelle sans risque budgétaire.
Ce statut « alpha » et anonyme est typique des previews que les laboratoires diffusent sur OpenRouter pour récolter du feedback avant un lancement officiel, sans révéler l’éditeur ni la date de sortie réelle. La gratuité explique en grande partie l’explosion d’usage constatée le 25 septembre 2026 : 3,30 billions de tokens traités, soit 14,7 % du trafic total, 1ᵉʳ rang tous éditeurs confondus. Restez prudents sur la pérennité de ce classement : un modèle gratuit attire mécaniquement les développeurs, et OpenRouter ne capte qu’une partie de l’usage réel de l’éditeur derrière ce nom de code.
Top 10 des modèles IA les plus utilisés
Classement détaillé : tokens, part de marché et prix
| # | Modèle | Éditeur | Tokens / jour | Part | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Space Bunny Alpha | Modèle furtif (stealth) | 5,20 T | 20,9 % | 0,00 / 0,00 | — | — | — |
| 2 | DeepSeek V4.1 Flash | DeepSeek | 3,92 T | 15,7 % | 0,30 / 1,20 | 39,5 | — | — |
| 3 | GLM 5.3 Flash | Z.ai (GLM) | 1,50 T | 6,0 % | 0,15 / 0,50 | 41,8 | 71,5 | 50,9 |
| 4 | MiMo-V2.6-Flash | Xiaomi | 1,43 T | 5,7 % | 0,14 / 0,28 | 37,9 | — | — |
| 5 | GPT-5.6 Luna | OpenAI | 1,27 T | 5,1 % | 0,20 / 1,20 | 37,3 | 71,4 | 42,1 |
| 6 | Hy4 preview | Tencent | 1,18 T | 4,7 % | 0,83 / 2,50 | — | — | — |
| 7 | DeepSeek V4 Flash 0731 | DeepSeek | 946 Md | 3,8 % | 0,01 / 1,28 | 34,3 | 69,1 | 41,0 |
| 8 | GPT-6 Luna | OpenAI | 808 Md | 3,2 % | 0,10 / 0,50 | 37,3 | — | — |
| 9 | Nemotron 3 Ultra | NVIDIA | 716 Md | 2,9 % | 0,60 / 2,40 | 22,9 | 49,3 | 20,1 |
| 10 | DeepSeek V4 Flash 0423 | DeepSeek | 479 Md | 1,9 % | 0,14 / 0,28 | 24,2 | 56,2 | 22,2 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Top 10 des éditeurs IA par volume de tokens
Comment lire ces chiffres sans leur faire dire n'importe quoi ?
Avant de vous jeter sur les classements, quelques précautions, parce que ces courbes sont trompeuses si on les lit trop vite. Un token n’est pas un utilisateur. Un seul agent de code qui tourne toute la nuit peut consommer plus qu’un millier de personnes qui posent trois questions dans un chat. Le volume mesure une intensité d’usage, pas une popularité.
- OpenRouter, c'est le monde des développeurs et des produits qui appellent une API. Les usages grand public (l'appli ChatGPT, Gemini dans Android, Claude sur le web) n'y passent pas. Anthropic et OpenAI sont donc largement sous-estimés ici par rapport à leur usage réel via leurs API directes ou les clouds (Bedrock, Vertex, Azure).
- Les modèles pas chers gonflent mécaniquement les volumes : à 0,05 $ le million de tokens, on laisse tourner sans compter. À 25 $ le million en sortie, on réfléchit à deux fois. C'est pour ça que les « flash » dominent.
- Je regroupe les variantes (standard, batch, gratuite) d'un même modèle et je classe par éditeur, c'est-à-dire par celui qui a entraîné le modèle, pas par celui qui l'héberge. Les pages « provider » d'OpenRouter, elles, comptent par hébergeur : c'est une autre lecture, souvent trompeuse (Alibaba Cloud y sert par exemple les modèles GLM de Z.ai).
- Les données sont celles de la dernière journée complète (J-1). Le jour en cours est partiel, donc jamais affiché.
Ce qu’il faut retenir, c’est que ces chiffres répondent à une question précise : quels modèles les développeurs choisissent-ils réellement quand ils paient au token ? C’est un signal très utile pour choisir un modèle dans un projet, beaucoup moins pour savoir qui « gagne la course à l’IA ».
DeepSeek : quel modèle est le plus utilisé ?
DeepSeek est le 1er éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 5,66 billions de tokens (22,7 % du total). Son modèle phare du moment est DeepSeek V4.1 Flash : 3,92 billions de tokens, 2e modèle tous éditeurs confondus, facturé 0,30 $ par million de tokens en entrée et 1,20 $ en sortie, contexte de 1 048 576 tokens.
DeepSeek V4.1 Flash est un modèle MoE bâti sur une nouvelle architecture Causal Encoder-Decoder : il active 8 milliards de paramètres en entrée et 16 milliards en sortie depuis un socle de 552 milliards de paramètres. Il est adapté aux agents de code, de terminal et d’usage d’ordinateur, ainsi qu’aux tâches longues et à l’analyse de contexte étendu. Comptez 0,15 $ par million de tokens en entrée et 0,60 $ en sortie, pour un contexte de 1 048 576 tokens. Sorti il y a une semaine seulement, ce modèle surfe sur un positionnement prix très agressif et une promesse d’efficacité pour les workflows agentiques : le compressed KV caching réduit la mémoire cache à environ un quart de la génération Flash précédente, ce qui limite fortement les coûts. DeepSeek annonce aussi des résultats de benchmarks devançant ses modèles phares, dont DeepSeek-V4-Pro. Sa domination sur OpenRouter (25,2 % des tokens de l’éditeur) reste toutefois à nuancer : la plateforme ne capte qu’une partie de l’usage réel, l’essentiel du trafic DeepSeek transitant probablement par l’API officielle ou des déploiements directs.
| # | Modèle | Tokens / jour | Part chez DeepSeek | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | DeepSeek V4.1 Flash | 3,92 T | 69,3 % | 2e | 0,30 / 1,20 | 39,5 | — | — |
| 2 | DeepSeek V4 Flash 0731 | 946 Md | 16,7 % | 7e | 0,01 / 1,28 | 34,3 | 69,1 | 41,0 |
| 3 | DeepSeek V4 Flash 0423 | 479 Md | 8,5 % | 10e | 0,14 / 0,28 | 24,2 | 56,2 | 22,2 |
| 4 | DeepSeek V4 Pro 0813 | 124 Md | 2,2 % | 27e | 0,66 / 1,98 | 36,0 | 68,8 | 41,3 |
| 5 | DeepSeek V4 Pro 0423 | 107 Md | 1,9 % | 31e | 0,96 / 1,91 | 30,4 | 59,4 | 26,3 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
OpenAI : quel modèle GPT est le plus utilisé ?
OpenAI est le 3e éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 3,14 billions de tokens (12,6 % du total). Son modèle phare du moment est GPT-5.6 Luna : 1,27 billions de tokens, 5e modèle tous éditeurs confondus, facturé 0,20 $ par million de tokens en entrée et 1,20 $ en sortie, contexte de 1 050 000 tokens.
Chez OpenAI, ce n’est pas le modèle le plus puissant qui domine, c’est GPT-5.6 Luna, le modèle rapide et économique de la série 5.6 sorti en juillet 2026. Il est conçu pour les usages à fort volume et faible latence : chat, classification, workflows agentiques légers, avec un raisonnement correct pour son étage de prix (environ 0,20 $ le million de tokens en entrée, 1,20 $ en sortie) et un contexte d’un million de tokens.
Pourquoi il est tendance ? Parce qu’il coche la case « assez bon et pas cher » avec la fiabilité d’appel d’outils d’OpenAI, ce qui en fait le moteur par défaut de beaucoup de produits SaaS. Les versions plus lourdes (Sol, Terra, et le tout récent GPT-6 Astra sorti début septembre) pèsent bien moins en volume : on les réserve aux tâches qui le méritent. Vous l’aurez compris, chez OpenAI comme ailleurs, c’est l’entrée de gamme qui fait le volume.
| # | Modèle | Tokens / jour | Part chez OpenAI | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Luna | 1,27 T | 40,6 % | 5e | 0,20 / 1,20 | 37,3 | 71,4 | 42,1 |
| 2 | GPT-6 Luna | 808 Md | 25,7 % | 8e | 0,10 / 0,50 | 37,3 | — | — |
| 3 | GPT-6 Sol | 222 Md | 7,1 % | 17e | 2,00 / 10,00 | 47,5 | — | — |
| 4 | GPT-5.6 Sol | 172 Md | 5,5 % | 23e | 2,00 / 10,00 | 47,0 | 77,4 | 50,2 |
| 5 | gpt-oss-120b | 108 Md | 3,4 % | 30e | 0,04 / 0,17 | 11,6 | 30,4 | 3,7 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Z.ai (GLM) : quel modèle est le plus utilisé ?
Z.ai (GLM) est le 4e éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 2,19 billions de tokens (8,8 % du total). Son modèle phare du moment est GLM 5.3 Flash : 1,50 billions de tokens, 3e modèle tous éditeurs confondus, facturé 0,15 $ par million de tokens en entrée et 0,50 $ en sortie, contexte de 1 048 576 tokens.
Z.ai (l’ex-Zhipu AI, éditeur de la famille GLM) place en tête GLM 5.3 Flash, un modèle multimodal natif sorti fin août 2026, conçu pour le code efficace et les agents qui travaillent longtemps sur une même tâche. Son architecture d’attention hybride (une partie « sparse », une partie linéaire) lui permet de rester précis sur des contextes très longs sans exploser les coûts.
Il est tendance pour une raison simple : à environ 0,07 $ le million de tokens en entrée et 0,25 $ en sortie, il joue dans la même cour que DeepSeek V4 Flash, avec la multimodalité en plus. Les développeurs qui font tourner des agents de code à la chaîne y trouvent un moteur bon marché. Petite subtilité pour lire les chiffres d’OpenRouter : GLM est souvent servi par des hébergeurs tiers, dont Alibaba Cloud, d’où le fait qu’il apparaisse sur la page « provider » d’Alibaba alors que ce n’est pas un modèle Alibaba.
| # | Modèle | Tokens / jour | Part chez Z.ai (GLM) | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | GLM 5.3 Flash | 1,50 T | 68,6 % | 3e | 0,15 / 0,50 | 41,8 | 71,5 | 50,9 |
| 2 | GLM 5.3 | 410 Md | 18,7 % | 13e | 1,40 / 4,40 | 44,8 | 74,8 | 53,1 |
| 3 | GLM 5.2 | 191 Md | 8,7 % | 21e | 0,25 / 3,99 | 33,7 | 68,8 | 38,4 |
| 4 | GLM 5.3 FlashX | 59 Md | 2,7 % | 48e | 0,37 / 1,25 | — | — | — |
| 5 | GLM 4.7 | 6,9 Md | 0,3 % | 109e | 0,60 / 2,20 | — | 45,3 | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Google : quel modèle Gemini est le plus utilisé ?
Google est le 7e éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 1,05 billions de tokens (4,2 % du total). Son modèle phare du moment est Gemini 3.8 Flash : 331 milliards de tokens, 14e modèle tous éditeurs confondus, facturé 0,75 $ par million de tokens en entrée et 3,75 $ en sortie, contexte de 1 048 576 tokens.
Chez Google, le modèle phare du moment est Gemini 3.8 Flash, sorti le 2 septembre 2026. Google le présente comme son Flash le plus intelligent, avec des gains notables sur l’ingénierie logicielle, les tâches agentiques et le raisonnement multi-étapes. Contexte d’un million de tokens, multimodal, et un tarif intermédiaire : environ 0,75 $ le million de tokens en entrée, 3,75 $ en sortie.
Pourquoi il monte ? Parce que c’est tout neuf, tout simplement : à chaque nouvelle version Flash, les développeurs migrent en quelques jours, ce qui explique que la version précédente (3.7 Flash) décroche aussi vite. Google joue la carte du « bon partout, pas cher, gros contexte », très efficace en volume. À noter que l’usage de Gemini via Google AI Studio ou Vertex directement n’apparaît pas ici : la part réelle de Google est donc plus élevée que ce que montre OpenRouter.
| # | Modèle | Tokens / jour | Part chez Google | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Gemini 3.8 Flash | 331 Md | 31,6 % | 14e | 0,75 / 3,75 | 40,9 | 76,3 | 40,2 |
| 2 | Gemini 2.5 Flash Lite | 113 Md | 10,8 % | 28e | 0,10 / 0,40 | — | — | — |
| 3 | Gemini 3 Flash Preview | 110 Md | 10,5 % | 29e | 0,50 / 3,00 | — | — | — |
| 4 | Gemini 3.1 Flash Lite | 86 Md | 8,2 % | 35e | 0,25 / 1,50 | — | — | — |
| 5 | Gemini 3.7 Flash | 85 Md | 8,1 % | 36e | 0,75 / 3,75 | 39,1 | 76,1 | 35,2 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Anthropic : quel modèle Claude est le plus utilisé ?
Anthropic est le 8e éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 962 milliards de tokens (3,9 % du total). Son modèle phare du moment est Claude Opus 5.5 : 313 milliards de tokens, 15e modèle tous éditeurs confondus, facturé 4,00 $ par million de tokens en entrée et 20,00 $ en sortie, contexte de 1 000 000 tokens.
Claude Opus 5.5 est le modèle haut de gamme d’Anthropic, pensé pour le raisonnement complexe, le code et les tâches agentiques longues. Il succède à Opus 5 et brille surtout sur les modifications multi-fichiers dans de grosses bases de code, avec un contexte d’1 000 000 de tokens qui lui permet d’ingérer des projets entiers. Comptez 4,00 $ par million de tokens en entrée et 20,00 $ en sortie, un tarif qui reste dans la fourchette premium des modèles Anthropic.
Sorti fin septembre 2026, ce modèle est encore récent, ce qui explique une adoption en cours plutôt qu’explosive : 242 milliards de tokens traités sur OpenRouter, soit seulement 1,1 % du volume total (14e place tous éditeurs confondus). Il devient toutefois le modèle le plus utilisé chez Anthropic, éditeur 9e du marché avec 4,1 % des tokens. À noter qu’OpenRouter ne capte qu’une fraction de l’usage réel, l’essentiel du trafic Claude passant par l’API directe d’Anthropic ou par des outils comme Claude Code.
| # | Modèle | Tokens / jour | Part chez Anthropic | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 | 313 Md | 32,5 % | 15e | 4,00 / 20,00 | 57,6 | — | — |
| 2 | Claude Sonnet 5 | 200 Md | 20,7 % | 19e | 2,00 / 10,00 | 38,2 | 71,5 | 43,6 |
| 3 | Claude Sonnet 5.5 | 99 Md | 10,3 % | 32e | 2,00 / 10,00 | 56,0 | — | — |
| 4 | Claude Opus 5 | 87 Md | 9,1 % | 34e | 5,00 / 25,00 | 50,8 | 78,0 | 56,5 |
| 5 | Claude Fable 5.1 | 71 Md | 7,4 % | 41e | 10,00 / 50,00 | 53,4 | 81,6 | 57,9 |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Moonshot AI (Kimi) : quel modèle est le plus utilisé ?
Moonshot AI (Kimi) est le 12e éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 317 milliards de tokens (1,3 % du total). Son modèle phare du moment est Kimi K3 : 276 milliards de tokens, 16e modèle tous éditeurs confondus, facturé 3,00 $ par million de tokens en entrée et 15,00 $ en sortie, contexte de 1 048 576 tokens.
Chez Moonshot AI, c’est Kimi K3 qui concentre l’usage : un modèle open-weight géant (2 800 milliards de paramètres, mélange d’experts), multimodal, orienté raisonnement, sorti mi-juillet 2026. Il est particulièrement fort en code complexe, en travail de connaissance et sur les workflows agentiques longs, là où il faut tenir un plan sur des dizaines d’étapes.
Il est tendance parce qu’il incarne l’open-weight « frontière » : des poids ouverts, une qualité comparable aux modèles fermés, et un prix (environ 3 $ le million de tokens en entrée, 15 $ en sortie) qui reste sous celui des Opus et autres GPT-6. Ce n’est pas un modèle de volume comme les « flash », mais un modèle de confiance pour ceux qui veulent du lourd sans dépendre d’un éditeur américain.
| # | Modèle | Tokens / jour | Part chez Moonshot AI (Kimi) | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 | 276 Md | 86,9 % | 16e | 3,00 / 15,00 | 43,6 | 76,2 | 50,0 |
| 2 | Kimi K2.6 | 24 Md | 7,7 % | 68e | 0,65 / 3,41 | 27,0 | 61,8 | 20,5 |
| 3 | Kimi K2.7 Code | 8,9 Md | 2,8 % | 100e | 0,67 / 3,35 | 25,8 | 60,8 | 21,0 |
| 4 | Kimi K2.5 | 6,6 Md | 2,1 % | 111e | 0,45 / 2,25 | — | 46,8 | — |
| 5 | Kimi K2 0905 | 0,9 Md | 0,3 % | 182e | 0,60 / 2,50 | — | — | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Alibaba (Qwen) : quel modèle est le plus utilisé ?
Alibaba (Qwen) est le 11e éditeur le plus utilisé sur OpenRouter le 29 septembre 2026, avec 412 milliards de tokens (1,7 % du total). Son modèle phare du moment est Qwen3.8 Flash : 87 milliards de tokens, 33e modèle tous éditeurs confondus, facturé 0,15 $ par million de tokens en entrée et 0,47 $ en sortie, contexte de 1 000 000 tokens.
Qwen3.8 Flash est un modèle de raisonnement multimodal signé Alibaba, pensé pour l’assistance au code, les workflows agentiques, la compréhension visuelle et l’analyse de documents, de bases de code, de graphiques ou même de vidéos longues. Il brille surtout sur les tâches où vitesse et coût comptent autant que la qualité : son prix de 0,15 $ en entrée et 0,47 $ en sortie par million de tokens, couplé à un contexte de 1 000 000 de tokens, en fait un candidat sérieux pour du traitement massif de données à moindre coût.
Ce positionnement tarifaire agressif explique en partie sa traction actuelle : avec 70 milliards de tokens traités en une journée, il devient le modèle le plus utilisé de l’éditeur sur OpenRouter, alors même que Qwen ne pèse que 1,6 % du trafic global de la plateforme (11e éditeur). Ce succès relatif s’inscrit dans la dynamique plus large d’Alibaba, qui multiplie les sorties de modèles open-weight compétitifs face aux offres occidentales. À noter : OpenRouter ne capture qu’une fraction de l’usage réel de Qwen, largement diffusé aussi via son API directe et son écosystème chinois.
| # | Modèle | Tokens / jour | Part chez Alibaba (Qwen) | Rang global | Prix ($/M) | Intelligence | Code | Agentique |
|---|---|---|---|---|---|---|---|---|
| 1 | Qwen3.8 Flash | 87 Md | 21,2 % | 33e | 0,15 / 0,47 | — | — | — |
| 2 | Qwen3.8 27B | 60 Md | 14,7 % | 46e | 0,42 / 3,00 | 33,7 | 68,1 | 45,8 |
| 3 | Qwen3.7 Flash | 53 Md | 12,9 % | 50e | 0,03 / 0,13 | — | — | — |
| 4 | Qwen3.8 Max (0902) | 42 Md | 10,1 % | 56e | 2,00 / 6,00 | 45,4 | 76,2 | 56,0 |
| 5 | qwen3-embedding-8b | 39 Md | 9,6 % | 59e | — | — | — | — |
Intelligence, Code et Agentique : indices Artificial Analysis (0 à 100), repris de l’API OpenRouter ; tiret = modèle non évalué. Prix en $ par million de tokens, entrée / sortie.
Comment cette page est-elle fabriquée ?
Pour ceux qui aiment savoir ce qu’il y a sous le capot (et parce que je préfère montrer la mécanique plutôt que vous demander de me croire sur parole), voici le pipeline, en gros :
- Chaque matin, un workflow n8n interroge le classement OpenRouter (celui qui alimente la page Rankings) et récupère, modèle par modèle, les tokens traités la veille, toutes variantes confondues.
- Les prix et fiches des modèles viennent de l'API publique d'OpenRouter (celle des modèles), donc les tarifs affichés sont ceux facturés le jour même.
- Le tout est agrégé par modèle puis par éditeur (préfixe du modèle : openai/, anthropic/, google/…), et archivé dans une table pour construire les courbes de tendance jour après jour.
- Les graphes sont dessinés en SVG directement par le workflow, sans outil externe : ils se mettent à jour dans la page et s'ouvrent en grand au clic.
- Les textes d'analyse par éditeur sont régénérés uniquement quand le modèle phare change, avec une recherche web pour comprendre pourquoi. Le reste du temps, seuls les chiffres bougent.
Aucun chiffre n’est retouché à la main. Si un jour une courbe vous paraît bizarre, c’est probablement OpenRouter qui a eu un hoquet, ou un modèle gratuit qui a fait un pic : ça arrive, et je préfère l’afficher que le lisser.
Ce qu'il faut retenir
L’IA la plus utilisée, c’est presque toujours la moins chère qui fait le job. Les modèles frontière font les gros titres, les modèles « flash » font les gros volumes. Si vous choisissez un modèle pour un projet, cette page vous dit où va l’argent des développeurs qui paient au token, et à quel prix. Ce qu’elle ne dit pas, c’est lequel est le meilleur pour votre cas : ça, il faut le tester.
Je fais tourner cette page comme un tableau de bord public, et je compte l’enrichir (part de dépense, et pas seulement de tokens ; évolution sur 90 jours ; peut-être d’autres sources que OpenRouter). Vous en pensez quoi, de cette lecture par les tokens ? Un éditeur que vous voudriez voir suivi ici ? Dites-le moi en commentaire.
Questions fréquentes
Quelle est l'IA la plus utilisée dans le monde ?
Ça dépend de ce qu’on mesure. En nombre d’utilisateurs grand public, ChatGPT reste largement devant. En volume de tokens consommés par les développeurs via une API multi-modèles comme OpenRouter, la tête du classement change presque chaque semaine : les modèles économiques (DeepSeek V4 Flash, GPT-5.6 Luna, GLM 5.3 Flash, Hy4) se disputent la première place. Cette page vous donne le classement de la veille, mis à jour chaque jour.
Pourquoi utiliser OpenRouter comme source et pas les éditeurs eux-mêmes ?
Parce que les éditeurs ne publient pas leurs volumes, et que quand ils le font, ce n’est pas comparable. OpenRouter est le seul endroit où plus de 400 modèles de tous les éditeurs sont consommés au même endroit, mesurés de la même façon et publiés ouvertement. C’est un échantillon biaisé (développeurs, API, sensibilité au prix), mais c’est un échantillon honnête.
Un token, c'est quoi exactement ?
C’est l’unité de découpage du texte par un modèle de langue, et donc l’unité de facturation. En pratique, un token vaut à peu près trois quarts d’un mot en anglais, un peu moins en français (nos accents et nos mots longs coûtent plus cher). Mille milliards de tokens, c’est environ l’équivalent de plusieurs millions de livres traités dans la journée.
Le modèle le plus utilisé est-il le meilleur ?
Non, et c’est même souvent l’inverse. Les modèles les plus consommés sont ceux qui offrent le meilleur rapport qualité/prix pour des tâches répétitives : extraction, classification, agents de code. Les modèles les plus performants sur les benchmarks (Claude Opus, GPT-6, Gemini Pro) sont plus chers, donc utilisés avec parcimonie, sur les tâches qui le méritent.
À quelle fréquence les chiffres sont-ils mis à jour ?
Tous les matins, avec les données de la dernière journée complète (J-1). Les courbes de tendance se construisent au fil des jours de collecte, et les textes d’analyse par éditeur sont réécrits automatiquement quand le modèle phare change.
Vous voulez mesurer votre propre visibilité dans les réponses des IA, ou brancher ce type de tableau de bord sur vos données ? On en parle.





















































