O que é o Hetzner Inference
O Hetzner Inference e a nova plataforma de inferência de inteligência artificial da Hetzner, empresa alemã conhecida por oferecer servidores e VPS a preços muito abaixo dos concorrentes como AWS, Azure e Google Cloud. Lançada em 2026, a plataforma permite rodar modelos de linguagem e outros modelos de IA em GPUs dedicadas sem precisar configurar infraestrutura própria.
Para quem trabalha com desenvolvimento de software e não quer depender exclusivamente das APIs de OpenAI ou Anthropic, o Hetzner Inference aparece como uma alternativa de custo controlado para hospedar modelos open-weight como Llama 3, Mistral, Qwen ou modelos de embedding como nomic-embed-text. A proposta e simples: mesmo hardware de qualidade, preço europeu competitivo.
A Hetzner já tem reputação solida entre devs europeus e brasileiros por seus servidores dedicados e VPS baratos. Trazer isso para o mundo de inferência de IA e uma extensão natural de como eles operam: infraestrutura sem frescura, sem tier de marketing inflado.
Como funciona
O Hetzner Inference oferece um endpoint de API compatível com o formato de API da OpenAI, o que significa que você pode usar a maioria das SDKs e ferramentas que já funcionam com GPT-4 ou outros modelos OpenAI, apenas trocando a base URL e o modelo. A compatibilidade com o formato /v1/chat/completions facilita muito a migração ou o uso paralelo.
Por baixo, a Hetzner roda os modelos em GPUs de alta performance em seus data centers europeus (principalmente Nuremberg e Helsinki). O serviço funciona no modelo pay-per-token: você paga pelo que usa, sem comprometimento mensal mínimo.
Para desenvolvimento local e experimentos, o Hetzner Inference pode ser combinado com ferramentas como LiteLLM ou OpenRouter para criar um gateway unificado que distribui chamadas entre diferentes provedores conforme custo e disponibilidade.
Se você já usa o cliente Python da OpenAI, migrar para o Hetzner Inference e mudar duas linhas: o base_url e o model. O resto do código fica idêntico.
Principais recursos
O Hetzner Inference entrega um conjunto solido para quem quer inferência de IA sem complexidade excessiva:
- Compatibilidade OpenAI API: drop-in replacement para a maioria dos casos de uso, sem reescrever integrações
- Modelos open-weight populares: Llama 3, Mistral, modelos de embedding - sem depender de modelos fechados
- Pay-per-token: sem comprometimento de instância ou pagar por GPU ociosa
- Data centers europeus: vantagem de latência para usuários na Europa e no Brasil comparado com us-east-1
- Preços competitivos: historicamente a Hetzner prática preço abaixo do mercado para infra equivalente
A plataforma também permite criar instâncias dedicadas de GPU para workloads que precisam de throughput alto e latência consistente, diferente do modelo serverless de inferência compartilhada.
O Hetzner Inference ainda e relativamente novo e o catalogo de modelos disponível e menor do que o de plataformas como Together AI ou Replicate. Verifique se o modelo que você precisa esta disponível antes de planejar uma migração.
Como começar: acesso passo a passo
Para começar a usar o Hetzner Inference, você precisa de uma conta Hetzner. Se já tem um servidor ou VPS deles, a mesma conta funciona.
# 1. Criar conta em console.hetzner.com
# 2. Acessar a secao Inference na Cloud Console
# 3. Gerar uma API Key na secao de tokens
# 4. Testar via curl
curl https://api.hetzner.cloud/inference/v1/chat/completions \
-H "Authorization: Bearer SEU_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"model": "meta-llama/Meta-Llama-3.1-8B-Instruct",
"messages": [{"role": "user", "content": "Ola! Qual e a capital do Brasil?"}]
}'Para usar com o SDK Python da OpenAI, a mudança e mínima:
pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://api.hetzner.cloud/inference/v1",
api_key="SEU_HETZNER_TOKEN"
)
resposta = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "Explique o que é RAG em 3 frases"}]
)
print(resposta.choices[0].message.content)Exemplo prático: RAG simples com Hetzner Inference
Um caso de uso concreto e construir um sistema de RAG (Retrieval-Augmented Generation) para responder perguntas sobre documentos internos. Com o Hetzner Inference, você pode rodar tanto o modelo de embedding quanto o modelo de geração no mesmo provedor:
from openai import OpenAI
client = OpenAI(
base_url="https://api.hetzner.cloud/inference/v1",
api_key="SEU_TOKEN"
)
# 1. Gerar embedding do documento
embedding = client.embeddings.create(
model="nomic-ai/nomic-embed-text-v1.5",
input="Texto do documento a ser indexado"
)
vector = embedding.data[0].embedding
# 2. Buscar no vector store e gerar resposta
contexto = buscar_no_vector_store(vector)
resposta = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-70B-Instruct",
messages=[
{"role": "system", "content": f"Contexto: {contexto}"},
{"role": "user", "content": "Qual e a política de ferias da empresa?"}
]
)Todo o pipeline roda em infraestrutura europeia da Hetzner, com controle total sobre quais dados saem da sua aplicação e para qual provedor.
Comparação com alternativas
O mercado de inferência de IA em nuvem esta cheio de opcoes. Onde o Hetzner se posiciona:
vs. OpenAI API: a OpenAI tem os modelos mais capazes (GPT-4o, o1), mas preço mais alto e modelos fechados. O Hetzner oferece modelos open-weight com preço potencialmente menor e sem lockin de modelo.
vs. Together AI / Replicate: ambos oferecem catalogo maior de modelos open-source. O Hetzner pode ganhar em preço e latência para usuários europeus, mas perde em variedade de modelos por enquanto.
vs. self-hosted Ollama: Ollama na sua VPS Hetzner e a opcao mais barata para volume alto, mas exige gerenciamento da instância, das atualizações e do scaling. O Hetzner Inference abstrai tudo isso.
vs. AWS Bedrock / Azure OpenAI: AWS e Azure tem ecossistema mais amplo e integrações corporativas, mas preço e complexidade são significativamente maiores. Para startups e projetos independentes, o Hetzner e mais acessível.
Pontos positivos e limitações
O Hetzner Inference tem pontos fortes claros para o público certo: preço competitivo, compatibilidade com API OpenAI e a reputação de confiabilidade da Hetzner em infraestrutura. Para equipes europeias com requisitos de residência de dados, ter os servidores na Alemanha ou Finlândia e um diferencial relevante para conformidade com GDPR.
As limitações são reais neste momento:
- Catalogo de modelos ainda menor que concorrentes especializados em inferência
- Documentação em fase inicial, menos exemplos e tutoriais que AWS ou Azure
- Modelos de ponta como GPT-4o ou Claude Opus não estão disponíveis (eles são fechados)
- Suporte e SLA ainda não tao maduros quanto os hiperescaladores para uso enterprise
Para projetos que precisam de fallback entre provedores, use o LiteLLM como proxy. Você configura Hetzner como provedor primário por custo e OpenAI como fallback, com roteamento automático quando o modelo não esta disponível.
Casos de uso reais
Startups de software com usuários europeus: requisitos de GDPR ficam mais simples quando os dados processados ficam em servidores na Alemanha ou Finlândia. O Hetzner Inference permite cumprir a regulamentação sem pagar premium por isso.
Desenvolvedores independentes e freelancers: API económica para adicionar funcionalidades de IA a projetos sem comprometimento mensal mínimo. Paga apenas pelo que usa.
Equipes que querem evitar lockin: como a API e compatível com OpenAI, e fácil testar o Hetzner em paralelo com outros provedores e migrar conforme necessidade, sem reescrever a integração.
Projetos de RAG e embeddings: ter modelo de embedding e modelo de geração no mesmo provedor simplifica a arquitetura e o billing de um pipeline completo de RAG.
Dicas e boas práticas
Comece pelo modelo 8B para desenvolvimento e testes. Só escale para 70B quando a qualidade do 8B não for suficiente para o seu caso de uso. A diferença de custo e significativa.
Ative o streaming (parâmetro stream: true) para respostas longas. Melhora muito a percepção de velocidade na interface do usuário, mesmo que o tempo total de geração seja o mesmo.
Para volume alto de requisições, calcule se uma instância GPU dedicada na Hetzner (Cloud GPU) com Ollama não sai mais barato do que o modelo pay-per-token. Para mais de algumas centenas de milhares de tokens por dia, a conta pode fechar melhor com instância própria.
Monitore o uso de tokens ativamente, especialmente no inicio. Bugs em loops de agentic AI podem gerar volume inesperado de requisições. Configure alertas de billing desde o primeiro dia.
Vale a pena?
Para devs que já usam Hetzner e querem adicionar IA sem abrir nova conta em outro provedor: sim, faz muito sentido consolidar. A integração e simples e o billing fica centralizado.
Para equipes europeias com requisitos de GDPR: o Hetzner Inference oferece uma combinação difícil de encontrar: preço acessível com infraestrutura na Europa, sem depender dos termos de privacidade das big techs americanas.
Para quem esta avaliando hoje: o próximo passo e criar uma conta gratuita em console.hetzner.com, acessar a secao de Inference e fazer os primeiros testes com o modelo Llama 3 8B. O custo de experimentar e praticamente zero, e a compatibilidade com a API da OpenAI garante que você não precisa de nenhuma mudança no seu código existente para testar.
Comentários
Deixar um comentárioVocê precisa ter uma conta no DevLevelUp para comentar.