Comparer les prix des modèles d’IA selon vos usages
Le prix d’entrée le plus bas peut donner la facture la plus élevée. Deux calculs montrent pourquoi.
Un modèle coûte 0,20 $ par million de jetons d'entrée. Un autre coûte 0,40 $. Le premier semble moins cher—jusqu'à ce que vous demandiez aux deux de rédiger une réponse longue.
Comparez le coût de l'ensemble de votre requête : le texte que vous envoyez, la réponse que vous attendez et la fréquence d'exécution. Vérifiez ensuite que le fournisseur proposant ce prix prend en charge les fonctionnalités dont vous avez besoin.
Commencez par une tâche réelle
Choisissez quelque chose que vous exécuterez réellement : résumer un document, réécrire un post ou répondre à une question de support. Comptez les instructions, l'historique de conversation et le texte joint comme entrée, pas seulement la question finale. Les jetons sont des morceaux de texte ; ils ne correspondent pas à un nombre fixe de mots selon les langues ou les modèles.
Ouvrez le catalogue de modèles IA, choisissez un modèle, puis ouvrez Estimation des coûts. Commencez avec un préréglage de tâche, ou saisissez vos propres jetons d'entrée, jetons de sortie et nombre de requêtes. Les préréglages sont des exemples modifiables, pas des mesures de vos documents.
Si vous avez déjà des journaux d'utilisation de l'API, utilisez leurs compteurs de jetons. Sinon, commencez avec une estimation et remplacez-la après un petit test. Une limite de contexte indique combien peut tenir, pas combien chaque requête coûtera.
Pourquoi un prix d’entrée plus bas peut coûter plus cher
Voici deux offres fictives, en USD par million de jetons. Elles illustrent le calcul ; ce ne sont pas des prix actuels pour des modèles nommés.
| Offre | Prix d'entrée | Prix de sortie |
|---|---|---|
| A | 0,20 $ | 1,00 $ |
| B | 0,40 $ | 0,40 $ |
Pour 10 000 requêtes avec 8 000 jetons d'entrée et 500 jetons de sortie chacune, A coûte 21 $, tandis que B coûte 34 $.
Changez la tâche à 1 000 jetons d'entrée et 4 000 jetons de sortie chacune, en gardant 10 000 requêtes. A coûte maintenant 42 $, tandis que B coûte 20 $. Les réponses plus longues inversent le classement.
total = requests × ((input tokens × input price) + (output tokens × output price)) / 1,000,000
Nous avons vérifié les deux exemples le 10 octobre 2026 avec la même fonction de coût de jetons utilisée par le catalogue. Téléchargez les entrées et résultats. Cela vérifie l'arithmétique, pas la qualité du modèle ni la facture réelle d'un fournisseur.
La formule simple suppose une tarification de texte ordinaire sans remises ni paliers. Les taux de cache et les paliers de contexte long peuvent modifier le résultat. Les appels d'outils, les images, l'audio, les frais par requête et les taxes peuvent ajouter des coûts au-delà de l'estimation textuelle. Pour une exécution réelle, comparez l'estimation avec le relevé d'utilisation du fournisseur ; OpenRouter documente les champs d'utilisation qu'il renvoie.
Comparez la même offre de fournisseur
L'entreprise qui développe un modèle et le service qui héberge son API sont des choix différents. Dans le catalogue, utilisez Créateurs de modèles pour restreindre la famille de modèles et Fournisseurs API pour choisir où l'utiliser. Les deux permettent des sélections multiples. Le label API officielle identifie l'API directe d'un développeur.
Ouvrez la liste des fournisseurs d'un modèle avant de choisir. Vérifiez ensemble son prix, son contexte et ses limites de sortie. Un prix bas chez un hôte et une grande fenêtre de contexte chez un autre ne constituent pas une offre utilisable.
Copiez l'ID du modèle depuis le fournisseur que vous prévoyez d'appeler. Des noms de modèles similaires ne garantissent pas des identifiants API identiques. Avec un agrégateur, vérifiez aussi le routage : OpenRouter peut router le même modèle vers différents points de terminaison, et la route sélectionnée affecte les fonctionnalités disponibles et le prix.
Utilisez des filtres pour établir une liste restreinte
Commencez par des exigences qui élimineraient un modèle : assez de contexte pour l'entrée et la réponse, prise en charge des images si nécessaire, et appel d'outils ou sortie structurée pour votre application. Ensuite, réduisez la fourchette de prix et comparez quelques candidats.
La vitesse a deux composantes. Le temps jusqu'au premier jeton décrit l'attente avant que la réponse ne commence. Les jetons de sortie par seconde décrivent la rapidité de la suite. Une mesure manquante signifie inconnu, pas lent ; une observation du fournisseur n'est pas une promesse concernant votre connexion ou votre invite.
Les scores de référence peuvent vous aider à choisir quoi tester. Ils ne peuvent pas vous dire si un modèle suivra vos instructions particulières. Exécutez le même petit ensemble d'invites représentatives contre votre liste restreinte et vérifiez les réponses, les échecs et l'utilisation réelle des jetons.
Le catalogue vise à se rafraîchir environ toutes les six heures. Vérifiez les horodatages des sources, surtout lorsqu'un prix ou une vitesse semble anormalement bon. Les filtres et le tri restent dans l'URL, vous pouvez donc copier l'adresse pour partager la même vue.
Répétez la comparaison depuis une application ou un agent
L'API du catalogue prend en charge les recherches filtrées, les comparaisons de fournisseurs et les estimations de coût de jetons. Les lectures du catalogue n'utilisent pas de crédits CozyToolkit et fonctionnent sans clé API, dans la limite de débit publiée. Elles n'exécutent pas les modèles pour vous.
La skill de recherche de modèles peut effectuer la recherche pour un agent. Donnez-lui la charge de travail, plutôt que de demander un « meilleur modèle » universel : trouvez trois candidats pour 10 000 requêtes de résumé de documents, chacune avec 8 000 jetons d'entrée et 500 jetons de sortie, et incluez les ID de fournisseurs, les coûts estimés et les sources.