Quanto custa a IA
Preço por milhão de tokens, entrada versus saída, o desconto do caching, por que áudio custa mais — e como funciona a cota do plano.
IA não tem mensalidade fixa por natureza — ela é cobrada por uso, como energia elétrica. Entender o medidor ajuda a usar bem a cota do plano e a decidir se vale ter chave própria.
O taxímetro: preço por milhão de tokens
Os provedores de IA cobram por token processado (o pedacinho de palavra que o modelo lê e escreve), com preço tabelado por milhão de tokens. Os valores são surpreendentemente baixos por unidade — frações de centavo por resposta no modelo padrão — mas multiplicam rápido em escala: mil conversas por mês são milhões de tokens.
Dois fatores mudam a conta:
- Modelo: o modelo avançado custa várias vezes o padrão, por token. É o motivo da recomendação de começar sempre no padrão.
- Tamanho da conversa: a cada resposta, o modelo relê as instruções e o histórico. Conversa longa = mais tokens por resposta.
Entrada custa diferente de saída
A tabela tem dois preços: tokens de entrada (o que o modelo lê: instruções, conhecimento, histórico) e de saída (o que ele escreve). A saída custa várias vezes mais por token — gerar texto exige mais computação que ler.
Parece contraintuitivo, mas na prática de atendimento a entrada domina o volume: o prompt do agente com todo o conhecimento tem milhares de tokens, e a resposta "Oi! Temos horário quinta às 14h" tem vinte. Por isso o próximo item importa tanto.
Prompt caching: o desconto do prefixo repetido
Repare: o começo do prompt do seu agente é idêntico em toda resposta — identidade, conhecimento, regras não mudam de uma mensagem para outra. Os provedores oferecem o prompt caching (cache de prompt): quando o início da requisição repete o da anterior, essa parte já processada sai com grande desconto.
É como o barista que já sabe seu pedido: não precisa recomeçar do zero, só perguntar "o de sempre?". O ScalaCRM monta o prompt numa ordem estável de propósito — o que muda (a conversa) fica no fim; o que repete (instruções e conhecimento) fica no começo e cai no cache. Você não configura nada; o desconto acontece sozinho.
Por que áudio custa mais
Áudio passa por processamentos extras, cada um com sua tarifa:
- Ouvir (transcrição): o áudio do cliente vira texto, cobrado pela duração do áudio;
- Falar (voz do agente): a resposta em texto vira áudio, cobrada pelo tamanho do texto.
Uma troca de áudios paga transcrição + resposta + geração de voz — por isso a resposta em áudio é opcional e configurável no agente.
A cota do plano, a carteira e a recarga automática
No ScalaCRM, o uso da IA nativa funciona assim:
- Créditos de IA do plano: seu plano inclui uma cota mensal de créditos de IA (1 crédito = 1 resposta do agente) — modelo simples, sem você acompanhar token nenhum. O consumo do mês aparece na página Agentes IA e no painel de uso do plano; chegando perto do limite, os administradores são avisados. No Essencial a cota é 0 — construir e testar o agente no Playground não gasta nenhum crédito; a cota só passa a existir quando o agente é ativado, a partir do Profissional.
- Carteira única de créditos: tudo que usa IA gasta da mesma carteira, com pesos: resposta do agente 1, resposta em áudio 2, copiloto 1, teste no playground 1, transcrição de áudio 1 por minuto iniciado. Acabou a cota do mês? O excedente custa R$ 59 a cada 1.000 créditos (não expiram) e a recarga automática cobra sozinha quando o disponível cai abaixo de 100 — no máximo 5 recargas por dia.
- Chave própria: recurso avançado, só para quem quer o modo avançado — veja Chave própria (avançado).
💡 Dica: duas alavancas baratas de economia: mantenha o modelo padrão (o avançado raramente compensa em atendimento) e enxugue o conhecimento do agente — material objetivo custa menos por resposta e ainda melhora a qualidade.
