Preview
Inferência de AI global em infraestrutura gerenciada
Crie e implemente aplicações inteligentes que executam modelos de AI próximos aos seus usuários — em qualquer escala.
Confiabilidade integrada
Arquitetura distribuída com failover automático mantém sua AI em execução.
API compatível com OpenAI
Mantenha seu código e SDKs atuais — basta alterar o endpoint.
Pague pelo uso
Você paga apenas quando seus modelos estão executando inferência.
Implemente a partir do seu ambiente local
Crie, depure e implemente workloads de AI da mesma forma que você já programa, mas com a escala de uma infraestrutura distribuída.
Baixa latência Deploy instantâneo Zero configuração Pague por requisição

Faça fine-tuning com LoRA
Adapte as saídas do modelo ao seu domínio usando Low-Rank Adaptation (LoRA), melhorando a precisão em tarefas especializadas e reduzindo custos de computação — sem precisar retreinar o modelo completo.
Saiba mais

Explore nossos modelos em destaque
Do hello world às workloads de AI em produção
Crie aplicações de AI com o mesmo workflow que você já usa para aplicações web modernas. AI Inference se conecta com SQL Database, Object Storage e Functions para que as equipes possam executar modelos, recuperar contexto, armazenar assets e executar lógica distribuída em uma única plataforma.
Docs
O que você pode construir com AI Inference
"Com a Azion, escalamos nossos modelos proprietários de AI sem nos preocupar com infraestrutura. Inspecionamos milhões de websites por dia e fazemos o takedown mais rápido do mercado."
Fabio Ramos
CEO
Primitivas que escalam com você
Perguntas Frequentes
O que é Azion AI Inference?
Azion AI Inference é uma plataforma serverless para implantar e executar modelos de AI em uma arquitetura distribuída. Ela oferece uma API compatível com OpenAI para facilitar a migração, suporta LLMs, VLMs, embeddings e modelos de reranking, e oferece fine-tuning com LoRA para personalização de domínio. Escale automaticamente sem gerenciar GPUs, mantendo respostas de baixa latência globalmente.
Quais modelos posso executar?
Escolha entre um catálogo de modelos open-source para geração de texto e código, tarefas de vision-language, embeddings e reranking. O catálogo evolui conforme novos modelos ficam disponíveis, e você pode fazer fine-tuning dos modelos compatíveis com LoRA para o seu domínio específico.
É compatível com a API da OpenAI?
Sim. AI Inference usa um formato de API compatível com OpenAI, então você pode migrar aplicações existentes atualizando apenas a URL base e as credenciais. Mantenha seus SDKs e padrões de integração atuais — sem necessidade de reescrever código.
Posso fazer fine-tuning de modelos?
Sim. AI Inference suporta fine-tuning com LoRA (Low-Rank Adaptation), permitindo especializar modelos para o seu domínio sem retreinamento completo. Isso reduz os custos de computação enquanto melhora a precisão em tarefas específicas, como suporte ao cliente, geração de código ou Q&A de domínio específico.
Como construo RAG e busca semântica?
Use AI Inference com o SQL Database Vector Search para armazenar embeddings e recuperar contexto relevante para aplicações RAG. Essa busca vetorial integrada significa que não é necessário gerenciar um banco de dados vetorial separado — SQL e vetores em um único serviço.
Posso construir AI agents e workflows com tool-calling?
Sim. AI Inference viabiliza padrões de agents como ReAct e workflows com tool-calling quando combinado com Applications, Functions e APIs externas. A Azion oferece templates e guias para arquiteturas de agents baseadas em LangChain e LangGraph.
Como faço para migrar do Cloudflare Workers AI?
A migração é simples graças às APIs compatíveis com OpenAI em ambas as plataformas. Atualize sua URL base para apontar para os endpoints do Azion AI Inference, migre eventuais adaptadores LoRA e integre com o Azion Functions. Se você usa o Cloudflare Vectorize, migre para o Azion SQL Database Vector Search, que já oferece armazenamento vetorial integrado.
Como o preço se compara a outras plataformas?
AI Inference usa um modelo de preços simples por requisição, sem unidades abstratas como "neurons". Você paga pelas requisições de inferência com base no modelo e no uso de tokens — sem custos de ociosidade, sem compromissos de capacidade. Essa transparência torna a previsão de custos mais previsível em comparação a modelos de cobrança baseados em neurons.
Como faço deploy de AI inference na minha aplicação?
Crie um endpoint de AI Inference e integre-o ao seu fluxo de requisições usando Applications e Functions. Isso adiciona capacidades de AI a APIs existentes e experiências de usuário, com execução distribuída, escalonamento gerenciado e failover automático.
Construa uma vez.Rode em qualquer lugar.
Ganhe um caminho mais rápido para lançar, menos latência e menos sobrecarga de infraestrutura.