//AI Inference

Preview

Inferência de AI global em infraestrutura gerenciada

Crie e implemente aplicações inteligentes que executam modelos de AI próximos aos seus usuários — em qualquer escala.

Docs

Confiabilidade integrada

Arquitetura distribuída com failover automático mantém sua AI em execução.

API compatível com OpenAI

Mantenha seu código e SDKs atuais — basta alterar o endpoint.

Pague pelo uso

Você paga apenas quando seus modelos estão executando inferência.

Implemente a partir do seu ambiente local

Crie, depure e implemente workloads de AI da mesma forma que você já programa, mas com a escala de uma infraestrutura distribuída.

Baixa latência Deploy instantâneo Zero configuração Pague por requisição

Saiba mais

Interface de fine-tuning LoRA para personalizar modelos de AI para desempenho específico de domínio.

Faça fine-tuning com LoRA

Adapte as saídas do modelo ao seu domínio usando Low-Rank Adaptation (LoRA), melhorando a precisão em tarefas especializadas e reduzindo custos de computação — sem precisar retreinar o modelo completo.
Saiba mais

Interface de fine-tuning LoRA para personalizar modelos de AI para desempenho específico de domínio.

Explore nossos modelos em destaque

Do hello world às workloads de AI em produção

Crie aplicações de AI com o mesmo workflow que você já usa para aplicações web modernas. AI Inference se conecta com SQL Database, Object Storage e Functions para que as equipes possam executar modelos, recuperar contexto, armazenar assets e executar lógica distribuída em uma única plataforma.
Docs

O que você pode construir com AI Inference

Automação

AI agents para workflows automatizados

Crie agents que planejam, chamam ferramentas e completam tarefas com respostas sensíveis ao contexto.

Apps de AI

Aplicações com AI (RAG + busca)

Crie RAG, busca semântica e experiências personalizadas usando a busca vetorial do SQL Database.

Mídia

Geração de imagens e AI visual

Gere, analise e transforme imagens com modelos de AI multimodais.

Áudio

Conversão de fala em texto e processamento de áudio

Transcreva, resuma e processe áudio com inferência de AI de baixa latência.

Suporte

Copilot de suporte ao cliente

Responda perguntas de clientes usando sua base de conhecimento e inferência de AI escalável.

Segurança

Detecção e remoção automatizada de ameaças

Classifique ameaças, detecte abusos e automatize ações de segurança com modelos de AI.

DNZ
Axur
Radware
Arezzo
Contabilizei
Magazine Luiza
Fourbank
iFood
Crefisa
Netshoes
Dafiti
Global Fashion Group
AXUR

"Com a Azion, escalamos nossos modelos proprietários de AI sem nos preocupar com infraestrutura. Inspecionamos milhões de websites por dia e fazemos o takedown mais rápido do mercado."

Fabio Ramos

CEO

//Completo, não complexo

Primitivas que escalam com você

Perguntas Frequentes

O que é Azion AI Inference?

Azion AI Inference é uma plataforma serverless para implantar e executar modelos de AI em uma arquitetura distribuída. Ela oferece uma API compatível com OpenAI para facilitar a migração, suporta LLMs, VLMs, embeddings e modelos de reranking, e oferece fine-tuning com LoRA para personalização de domínio. Escale automaticamente sem gerenciar GPUs, mantendo respostas de baixa latência globalmente.

Quais modelos posso executar?

Escolha entre um catálogo de modelos open-source para geração de texto e código, tarefas de vision-language, embeddings e reranking. O catálogo evolui conforme novos modelos ficam disponíveis, e você pode fazer fine-tuning dos modelos compatíveis com LoRA para o seu domínio específico.

É compatível com a API da OpenAI?

Sim. AI Inference usa um formato de API compatível com OpenAI, então você pode migrar aplicações existentes atualizando apenas a URL base e as credenciais. Mantenha seus SDKs e padrões de integração atuais — sem necessidade de reescrever código.

Posso fazer fine-tuning de modelos?

Sim. AI Inference suporta fine-tuning com LoRA (Low-Rank Adaptation), permitindo especializar modelos para o seu domínio sem retreinamento completo. Isso reduz os custos de computação enquanto melhora a precisão em tarefas específicas, como suporte ao cliente, geração de código ou Q&A de domínio específico.

Como construo RAG e busca semântica?

Use AI Inference com o SQL Database Vector Search para armazenar embeddings e recuperar contexto relevante para aplicações RAG. Essa busca vetorial integrada significa que não é necessário gerenciar um banco de dados vetorial separado — SQL e vetores em um único serviço.

Posso construir AI agents e workflows com tool-calling?

Sim. AI Inference viabiliza padrões de agents como ReAct e workflows com tool-calling quando combinado com Applications, Functions e APIs externas. A Azion oferece templates e guias para arquiteturas de agents baseadas em LangChain e LangGraph.

Como faço para migrar do Cloudflare Workers AI?

A migração é simples graças às APIs compatíveis com OpenAI em ambas as plataformas. Atualize sua URL base para apontar para os endpoints do Azion AI Inference, migre eventuais adaptadores LoRA e integre com o Azion Functions. Se você usa o Cloudflare Vectorize, migre para o Azion SQL Database Vector Search, que já oferece armazenamento vetorial integrado.

Como o preço se compara a outras plataformas?

AI Inference usa um modelo de preços simples por requisição, sem unidades abstratas como "neurons". Você paga pelas requisições de inferência com base no modelo e no uso de tokens — sem custos de ociosidade, sem compromissos de capacidade. Essa transparência torna a previsão de custos mais previsível em comparação a modelos de cobrança baseados em neurons.

Como faço deploy de AI inference na minha aplicação?

Crie um endpoint de AI Inference e integre-o ao seu fluxo de requisições usando Applications e Functions. Isso adiciona capacidades de AI a APIs existentes e experiências de usuário, com execução distribuída, escalonamento gerenciado e failover automático.

//Build

Construa uma vez.
Rode em qualquer lugar.

Ganhe um caminho mais rápido para lançar, menos latência e menos sobrecarga de infraestrutura.