aleff.
Glossário

LiteLLM (gateway de IA)

LiteLLM é um gateway open-source que roteia chamadas de IA para 140+ modelos com uma API única — sem prender sua operação a um só provedor.

Por Aleff Pimenta · · Também conhecido como: LiteLLM, gateway LLM, proxy de IA, roteador de modelos

LiteLLM é uma camada de software open-source que funciona como gateway entre a sua aplicação e os provedores de IA — OpenAI, Anthropic, Google Gemini, AWS Bedrock, modelos locais via Ollama — expondo uma API única no formato OpenAI, independente de qual modelo está rodando por baixo.

Em vez de escrever código diferente para cada provedor, você chama sempre o mesmo endpoint. O LiteLLM traduz, roteia, e retorna. Troca de modelo sem mudar uma linha de código na sua aplicação.

Como funciona na prática

O LiteLLM roda como um servidor próprio dentro da sua infra — um container Docker, uma VM, um cluster Kubernetes. Ele recebe a chamada de IA da sua aplicação, decide qual modelo usar (por custo, disponibilidade ou regra que você define), e encaminha ao provedor correto.

Internamente ele usa Postgres para logging e Redis para cache. Isso significa que cada chamada fica registrada: qual modelo respondeu, quantos tokens custou, qual prompt entrou. Observabilidade real, não caixa-preta.

Por que isso importa para a clínica ou o escritório que usa IA

Quem contrata uma solução de IA “empacotada” normalmente não sabe qual modelo está rodando, quanto cada chamada custa, nem o que acontece se o provedor subir o preço ou sair do ar.

Com um gateway como o LiteLLM rodando na sua infra, você vira o controlador das decisões: roteia dado sensível de paciente para um modelo local (Ollama, sem sair do servidor), e dado não sensível para GPT-4o quando precisa de mais capacidade. Cloud para escalar, local para dado sensível — a escolha fica com você, não com o fornecedor que empacotou o serviço.

Isso é a Crença #2 aplicada em camada técnica: você decide onde cada inferência acontece.

O erro comum: deixar o provedor decidir por você

A maioria das implementações de IA em PME começa com código direto na API da OpenAI — funciona no piloto, vira problema em produção. Quando a OpenAI lança um modelo novo mais barato, você precisa mudar código. Quando seu cliente pede que dados de saúde não saiam do Brasil, você não tem para onde redirecionar.

Sem gateway, trocar de provedor é um projeto de semanas. Com LiteLLM, é uma linha de configuração.

Como aplicar hoje

Se você já tem agente de IA rodando na empresa — ou está montando do zero — o gateway é a peça que garante que você não fique preso em um provedor para sempre.

Três passos para começar:

  1. Suba o LiteLLM em container na sua infra (20 minutos com Docker Compose, Postgres e Redis já configurados)
  2. Configure as rotas: dado sensível → modelo local; processamento geral → API externa com sua chave BYOK
  3. Ative o logging: cada chamada registrada com custo, modelo e timestamp — audit trail nativo

Se quiser ver isso rodando no seu cenário — agente de WhatsApp para clínica, escritório ou imobiliária com roteamento entre modelos — o Sprint IA de 14 dias é como a gente monta: você sai com gateway configurado, rotas definidas por sensibilidade de dado, e dashboard de custo por chamada.

Termos relacionados

Fontes

Produtos relacionados