Quanto custa, de fato, rodar agentes de IA? O guia que o mercado não quer que você leia.

Pergunte a qualquer fornecedor quanto custa um agente de IA. Na melhor das hipóteses, você vai ouvir um número redondo e simpático. Muitas vezes, você não vai ouvir número nenhum.
E até o valor apresentado na proposta é pensado para facilitar o “sim” . O custo de agentes de IA quase nunca está ali. Ele está espalhado no consumo, na integração, na revisão humana e no tempo, e vai se somando mês a mês sem que ninguém tenha combinado isso. Este guia junta o que costuma ficar de fora da conversa comercial.
O preço de vitrine engana
O mercado se organizou em alguns modelos de cobrança, e cada um guarda o custo num lugar diferente.

Repare na pegadinha do modelo por conversa. Se o agente resolve 6 de cada 10 atendimentos, você ainda pagou pelos outros 4 que ele não resolveu. O que parece barato por interação vira caro quando você soma o que não deu resultado.
O custo que ninguém coloca na proposta
O preço do agente é só o começo. A maior parte do custo da IA está no que não vem escrito na proposta.
O primeiro é a integração. Conectar o agente aos seus sistemas, aos seus dados e aos seus fluxos é trabalho de engenharia, e é uma das maiores fatias do custo escondido. Depois vem a implementação, a configuração e a revisão humana, o tempo do seu time garantindo que o agente não faça besteira. Nada disso aparece no valor inicial.
O terceiro é mais silencioso: a autonomia do agente. Um agente simples faz uma consulta e para. Um agente que planeja tarefas, escolhe ferramentas, trata exceções e repete até atingir o objetivo dispara várias chamadas ao modelo a cada decisão. E essa autonomia está crescendo rápido.
O METR, uma organização independente de avaliação de IA, mostra que a duração das tarefas que os agentes conseguem concluir sozinhos vem dobrando mais ou menos a cada sete meses [2]. Traduzindo: os agentes estão assumindo trabalhos cada vez mais longos e com mais passos. E cada passo é uma nova chamada ao modelo, ou seja, mais consumo por resultado entregue.
Por que a conta cresce quando você menos espera
Existe um motivo técnico para a fatura surpreender, e ele é contraintuitivo. O preço da tecnologia despencou. Segundo o Índice de IA da Universidade Stanford, o custo para processar um milhão de tokens num modelo equivalente ao GPT-3.5 caiu de cerca de US$ 20, no fim de 2022, para US$ 0,07, no fim de 2024, uma queda de aproximadamente 280 vezes em 18 meses [1]. Dependendo da tarefa, os preços caíram entre 9 e 900 vezes por ano [1].
E aqui está o paradoxo. Mesmo com o preço unitário despencando, o investimento das empresas em IA cresceu, chegando a US$ 252 bilhões em 2024, 26% a mais que no ano anterior [1]. O preço por token caiu, o gasto total subiu.
O motivo é simples: o consumo cresce mais rápido do que o preço cai. Tem ainda um detalhe que infla a conta, apontado por referências independentes que acompanham os preços dos modelos, como o Artificial Analysis: a resposta que o modelo gera costuma custar mais caro que a pergunta que você envia [3]. Fluxos com agentes, que geram muito texto e carregam bastante contexto, batem justamente na parte cara.
A queixa mais comum de quem coloca agentes em produção não é o preço alto. É a imprevisibilidade da fatura.
O barato que sai caro em três anos
O modelo mais barato no piloto raramente é o mais barato quando você projeta pra frente. A razão é direta: os modelos baseados em consumo crescem junto com o uso, e o uso só aumenta, porque os agentes assumem tarefas cada vez mais longas [2]. O que fechou uma conta camarada num teste de baixo volume pode virar a fatura mais salgada quando roda pra valer, todos os dias, no volume real da operação.
Ou seja, escolher o modelo de cobrança não é uma decisão de compra pontual. É uma decisão de orçamento de longo prazo, e o número que parece pequeno hoje pode ser o mais caro daqui a trinta e seis meses.
As perguntas que revelam o custo real
Não dá pra prever cada centavo, mas dá pra fazer as perguntas que tiram o custo do escuro antes de assinar ou renovar:
Qual é o custo total em 12 e em 36 meses, no meu volume real e não no volume do piloto?
Eu pago quando o agente não resolve? Quanto do meu gasto vira desperdício nesse caso?
O consumo de tokens está incluído ou é cobrado à parte? Como ele cresce quando as conversas ficam mais longas?
Quanto custam a integração, a implementação e a revisão humana, que não aparecem na proposta?
Existe cobrança por agente? Se eu quiser dez agentes, a conta multiplica por dez?
Quão previsível é a fatura? Eu tenho um teto ou ela pode disparar num mês de pico?
Eu tenho um ambiente onde eu posso controlar a operação por agente, departamento e consumo?
Gerenciamento de performance e consumo
A observabilidade permite acompanhar o desempenho dos agentes e o consumo de IA. No Zia Agents, por exemplo, é possível visualizar tokens, sessões, execuções, latência e taxa de sucesso, relacionando o uso aos modelos e tarefas executadas. Esses dados ajudam a identificar padrões e otimizar a relação entre uso, performance e custo
Com a IA da Zoho, não há cobrança específica por agente criado, implantado ou gerenciado. Ou seja, o custo não aumenta simplesmente porque a empresa criou mais agentes, mas conforme o volume de processamento utilizado. Para LLMs hospedados pela Zoho, o usuário tem 30 milhões de tokens gratuitos por mês.
A partir desse limite, o consumo excedente é cobrado conforme a tarifa do modelo. Por exemplo, com 35 milhões de tokens utilizados, os 5 milhões excedentes seriam cobrados a US$ 1 por milhão, totalizando US$ 5 adicionais.
Para LLMs externos, como OpenIA, Gemini ou Claude, aplicam-se os preços definidos pelo próprio fornecedor. Dessa forma, a empresa paga pelo processamento do modelo utilizado, enquanto integrações via API com produtos como Zoho CRM e Zoho Desk seguem os créditos previstos para esses serviços.
Previsibilidade virou o diferencial
O mercado gosta de vender o número pequeno da vitrine porque o número grande fica guardado no consumo, na integração e no tempo. A pergunta certa nunca foi "quanto custa o agente". É "quanto eu vou pagar de verdade daqui a três anos, no meu volume, com tudo somado".
E os modelos que amadurecem melhor são os previsíveis. Quando a IA já vem integrada à plataforma, como no ecossistema da Zoho, o custo de implementação cai. Sem cobrança por agente, a expansão não vira uma escalada de licenças. E quando o contexto do negócio já está incorporado, você não precisa gastar mais para conectar dados e ensinar à IA como a sua operação funciona.
Esse é o guia que o mercado não quer que você leia. O custo de um agente não está no preço dele. Está em tudo que vem junto.
Fontes
[1] Stanford HAI, "Artificial Intelligence Index Report 2025", Capítulo 1. Disponível em: https://hai.stanford.edu/ai-index/2025-ai-index-report
[2] METR, "Measuring AI Ability to Complete Long Software Tasks" (2025). Disponível em: https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/
[3] Artificial Analysis, referência independente de comparação de preços e desempenho de modelos de IA. Disponível em: https://artificialanalysis.ai/




Comments