Todos os guias
IA

Compare preços de modelos de IA para o seu uso real

Uma entrada mais barata pode gerar uma conta maior. Dois exemplos de cálculo mostram por quê.

Um modelo custa US$ 0,20 por milhão de tokens de entrada. Outro custa US$ 0,40. O primeiro parece mais barato—até você pedir que ambos escrevam uma resposta longa.

Compare o custo de toda a sua solicitação: o texto que você envia, a resposta que espera e a frequência com que executa. Depois, verifique se o provedor que oferece esse preço suporta os recursos que você precisa.

Comece com uma tarefa real

Escolha algo que você realmente vai executar: resumir um documento, reescrever um post ou responder a uma pergunta de suporte. Conte as instruções, o histórico da conversa e o texto anexado como entrada, não apenas a pergunta final. Tokens são pedaços de texto; eles não são um número fixo de palavras entre idiomas ou modelos.

Abra o catálogo de modelos de IA, escolha um modelo e abra Estimativa de custo. Comece com um preset de tarefa ou insira seus próprios tokens de entrada, tokens de saída e número de solicitações. Os presets são exemplos editáveis, não medições dos seus documentos.

Se você já tem logs de uso da API, use as contagens de tokens deles. Caso contrário, comece com uma estimativa e substitua-a após um pequeno teste. Um limite de contexto informa quanto cabe, não quanto cada solicitação vai custar.

Por que a entrada mais barata pode custar mais no total

Estas são duas ofertas fictícias, em USD por milhão de tokens. Elas ilustram o cálculo; não são preços atuais para modelos nomeados.

Oferta Preço de entrada Preço de saída
A $0,20 $1,00
B $0,40 $0,40

Para 10.000 solicitações com 8.000 tokens de entrada e 500 tokens de saída cada, A custa US$ 21, enquanto B custa US$ 34.

Mude a tarefa para 1.000 tokens de entrada e 4.000 tokens de saída cada, mantendo 10.000 solicitações. A agora custa US$ 42, enquanto B custa US$ 20. As respostas mais longas invertem a classificação.

total = requests × ((input tokens × input price) + (output tokens × output price)) / 1,000,000

Verificamos ambos os exemplos em 10 de outubro de 2026 com a mesma função de custo de tokens usada pelo catálogo. Baixe as entradas e os resultados. Isso verifica a aritmética, não a qualidade do modelo ou a fatura real de um provedor.

A fórmula simples assume preços de texto comuns, sem descontos ou faixas. Taxas de cache e faixas de contexto longo podem alterar o resultado. Chamadas de ferramentas, imagens, áudio, taxas por solicitação e impostos podem adicionar cobranças além da estimativa de texto. Para uma execução real, compare a estimativa com o registro de uso do provedor; o OpenRouter documenta os campos de uso que retorna.

Compare a mesma oferta de provedor

A empresa que desenvolve um modelo e o serviço que hospeda sua API são escolhas diferentes. No catálogo, use Criadores de modelos para restringir a família de modelos e Provedores de API para escolher onde usá-lo. Ambos permitem múltiplas seleções. O rótulo API oficial identifica a API direta do desenvolvedor.

Abra a lista de provedores de um modelo antes de escolher. Verifique preço, contexto e limites de saída juntos. Um preço baixo de um host e uma janela de contexto grande de outro não formam uma oferta utilizável.

Copie o ID do modelo do provedor que você planeja chamar. Nomes de modelos semelhantes não garantem identificadores de API idênticos. Com um agregador, verifique também o roteamento: o OpenRouter pode rotear o mesmo modelo para endpoints diferentes, e a rota selecionada afeta os recursos e o preço disponíveis.

Use filtros para criar uma lista curta

Comece com requisitos que descartariam um modelo: contexto suficiente para a entrada e a resposta, suporte a imagens se necessário e chamada de ferramentas ou saída estruturada para sua aplicação. Depois, restrinja a faixa de preço e compare alguns candidatos.

A velocidade tem duas partes. O tempo até o primeiro token descreve a espera antes de uma resposta começar. Tokens de saída por segundo descreve a rapidez com que ela continua. Uma medição ausente significa desconhecido, não lento; uma observação do provedor não é uma promessa sobre sua conexão ou prompt.

Pontuações de benchmark podem ajudar você a escolher o que testar. Elas não podem dizer se um modelo seguirá suas instruções específicas. Execute o mesmo pequeno conjunto de prompts representativos contra sua lista curta e verifique as respostas, falhas e uso real de tokens.

O catálogo visa atualizar cerca de a cada seis horas. Verifique os timestamps das fontes, especialmente quando um preço ou velocidade parecer excepcionalmente bom. Filtros e ordenação permanecem na URL, então você pode copiar o endereço para compartilhar a mesma visualização.

Repita a comparação de um app ou agente

A API do catálogo suporta buscas filtradas, comparações de provedores e estimativas de custo de tokens. Leituras do catálogo não usam créditos do CozyToolkit e funcionam sem chave de API, dentro do limite de taxa publicado. Elas não executam os modelos por você.

A habilidade de pesquisa de modelos pode fazer a busca por um agente. Dê a ela a carga de trabalho, em vez de pedir um "melhor modelo" universal: encontre três candidatos para 10.000 solicitações de resumo de documentos, cada uma com 8.000 tokens de entrada e 500 de saída, e inclua IDs de provedores, custos estimados e fontes.