KI-Modellpreise für deinen tatsächlichen Bedarf vergleichen
Der niedrigste Eingabepreis kann zur höheren Rechnung führen. Zwei Rechenbeispiele zeigen, worauf es ankommt.
Ein Modell kostet 0,20 $ pro Million Eingabetokens. Ein anderes kostet 0,40 $. Das erste wirkt günstiger – bis du beide bittest, eine lange Antwort zu schreiben.
Vergleiche die Kosten deiner gesamten Anfrage: den Text, den du sendest, die Antwort, die du erwartest, und wie oft du sie ausführst. Prüfe dann, ob der Anbieter mit diesem Preis die Funktionen unterstützt, die du brauchst.
Beginne mit einer echten Aufgabe
Wähle etwas, das du tatsächlich ausführen wirst: ein Dokument zusammenfassen, einen Beitrag umschreiben oder eine Support-Frage beantworten. Zähle Anweisungen, Gesprächsverlauf und angehängten Text als Eingabe, nicht nur die eigentliche Frage. Tokens sind Textstücke; sie sind keine feste Anzahl von Wörtern über Sprachen oder Modelle hinweg.
Öffne den KI-Modellkatalog, wähle ein Modell und öffne dann Kostenschätzung. Beginne mit einer Aufgaben-Voreinstellung oder gib eigene Eingabetokens, Ausgabetokens und Anzahl der Anfragen ein. Voreinstellungen sind bearbeitbare Beispiele, keine Messungen deiner Dokumente.
Wenn du bereits API-Nutzungsprotokolle hast, verwende deren Tokenzahlen. Andernfalls beginne mit einer Schätzung und ersetze sie nach einem kleinen Test. Ein Kontextlimit sagt dir, wie viel hineinpasst, nicht wie viel jede Anfrage kosten wird.
Warum der niedrigere Eingabepreis nicht immer günstiger ist
Das sind zwei fiktive Angebote, in USD pro Million Tokens. Sie veranschaulichen die Berechnung; sie sind keine aktuellen Preise für benannte Modelle.
| Angebot | Eingabepreis | Ausgabepreis |
|---|---|---|
| A | 0,20 $ | 1,00 $ |
| B | 0,40 $ | 0,40 $ |
Bei 10.000 Anfragen mit 8.000 Eingabetokens und 500 Ausgabetokens pro Anfrage kostet A 21 $, während B 34 $ kostet.
Ändere die Aufgabe auf 1.000 Eingabetokens und 4.000 Ausgabetokens pro Anfrage, bei 10.000 Anfragen. A kostet jetzt 42 $, während B 20 $ kostet. Die längeren Antworten kehren die Reihenfolge um.
total = requests × ((input tokens × input price) + (output tokens × output price)) / 1,000,000
Wir haben beide Beispiele am 10. Oktober 2026 mit derselben Token-Kostenfunktion geprüft, die auch der Katalog verwendet. Lade die Eingaben und Ergebnisse herunter. Das prüft die Rechnung, nicht die Modellqualität oder die tatsächliche Rechnung eines Anbieters.
Die einfache Formel geht von normaler Textpreisgestaltung ohne Rabatte oder Stufen aus. Cache-Tarife und Langkontext-Stufen können das Ergebnis verändern. Tool-Aufrufe, Bilder, Audio, Gebühren pro Anfrage und Steuern können zusätzliche Kosten über die Textschätzung hinaus verursachen. Für einen echten Lauf vergleiche die Schätzung mit dem Nutzungsprotokoll des Anbieters; OpenRouter dokumentiert die Nutzungsfelder, die es zurückgibt.
Vergleiche dasselbe Anbieterangebot
Das Unternehmen, das ein Modell entwickelt, und der Dienst, der seine API hostet, sind unterschiedliche Entscheidungen. Im Katalog verwende Modellentwickler, um die Modellfamilie einzugrenzen, und API-Anbieter, um zu wählen, wo du es nutzt. Beide erlauben Mehrfachauswahl. Das Label Offizielle API kennzeichnet die direkte API eines Entwicklers.
Öffne die Anbieterliste eines Modells, bevor du wählst. Prüfe Preis, Kontext und Ausgabelimits zusammen. Ein niedriger Preis von einem Host und ein großes Kontextfenster von einem anderen ergeben kein nutzbares Angebot.
Kopiere die Modell-ID von dem Anbieter, den du aufrufen willst. Ähnliche Modellnamen garantieren keine identischen API-Kennungen. Bei einem Aggregator prüfe auch das Routing: OpenRouter kann dasselbe Modell an verschiedene Endpunkte weiterleiten, und die gewählte Route beeinflusst verfügbare Funktionen und Preis.
Filter für eine Shortlist nutzen
Beginne mit Anforderungen, die ein Modell ausschließen würden: genug Kontext für Eingabe und Antwort, Bildunterstützung falls nötig, und Tool-Aufrufe oder strukturierte Ausgabe für deine Anwendung. Grenze dann die Preisspanne ein und vergleiche ein paar Kandidaten.
Geschwindigkeit hat zwei Teile. Die Zeit bis zum ersten Token beschreibt die Wartezeit, bevor eine Antwort beginnt. Ausgabetokens pro Sekunde beschreibt, wie schnell sie fortgesetzt wird. Eine fehlende Messung bedeutet unbekannt, nicht langsam; eine Anbieterbeobachtung ist kein Versprechen für deine Verbindung oder deinen Prompt.
Benchmark-Werte können dir helfen zu wählen, was du testen willst. Sie können dir nicht sagen, ob ein Modell deine spezifischen Anweisungen befolgt. Führe denselben kleinen Satz repräsentativer Prompts gegen deine Shortlist aus und prüfe die Antworten, Fehler und den tatsächlichen Tokenverbrauch.
Der Katalog aktualisiert sich etwa alle sechs Stunden. Prüfe die Quellzeitstempel, besonders wenn ein Preis oder eine Geschwindigkeit ungewöhnlich gut aussieht. Filter und Sortierung bleiben in der URL, sodass du die Adresse kopieren kannst, um dieselbe Ansicht zu teilen.
Den Vergleich aus einer App oder einem Agenten wiederholen
Die Katalog-API unterstützt gefilterte Suchen, Anbietervergleiche und Token-Kostenschätzungen. Katalog-Lesezugriffe verbrauchen keine CozyToolkit-Guthaben und funktionieren ohne API-Schlüssel, innerhalb der veröffentlichten Anfragelimits. Sie führen die Modelle nicht für dich aus.
Die Skill für die Modellrecherche kann die Suche für einen Agenten übernehmen. Gib ihr die Arbeitslast, statt nach einem universellen „besten Modell“ zu fragen: Finde drei Kandidaten für 10.000 Dokument-Zusammenfassungsanfragen, jeweils mit 8.000 Eingabe- und 500 Ausgabetokens, und nimm Anbieter-IDs, geschätzte Kosten und Quellen auf.