O que é o Hetzner Inference

O Hetzner Inference e a nova plataforma de inferência de inteligência artificial da Hetzner, empresa alemã conhecida por oferecer servidores e VPS a preços muito abaixo dos concorrentes como AWS, Azure e Google Cloud. Lançada em 2026, a plataforma permite rodar modelos de linguagem e outros modelos de IA em GPUs dedicadas sem precisar configurar infraestrutura própria.

Para quem trabalha com desenvolvimento de software e não quer depender exclusivamente das APIs de OpenAI ou Anthropic, o Hetzner Inference aparece como uma alternativa de custo controlado para hospedar modelos open-weight como Llama 3, Mistral, Qwen ou modelos de embedding como nomic-embed-text. A proposta e simples: mesmo hardware de qualidade, preço europeu competitivo.

A Hetzner já tem reputação solida entre devs europeus e brasileiros por seus servidores dedicados e VPS baratos. Trazer isso para o mundo de inferência de IA e uma extensão natural de como eles operam: infraestrutura sem frescura, sem tier de marketing inflado.

Como funciona

O Hetzner Inference oferece um endpoint de API compatível com o formato de API da OpenAI, o que significa que você pode usar a maioria das SDKs e ferramentas que já funcionam com GPT-4 ou outros modelos OpenAI, apenas trocando a base URL e o modelo. A compatibilidade com o formato /v1/chat/completions facilita muito a migração ou o uso paralelo.

Por baixo, a Hetzner roda os modelos em GPUs de alta performance em seus data centers europeus (principalmente Nuremberg e Helsinki). O serviço funciona no modelo pay-per-token: você paga pelo que usa, sem comprometimento mensal mínimo.

Para desenvolvimento local e experimentos, o Hetzner Inference pode ser combinado com ferramentas como LiteLLM ou OpenRouter para criar um gateway unificado que distribui chamadas entre diferentes provedores conforme custo e disponibilidade.

💡
Dica

Se você já usa o cliente Python da OpenAI, migrar para o Hetzner Inference e mudar duas linhas: o base_url e o model. O resto do código fica idêntico.

Principais recursos

O Hetzner Inference entrega um conjunto solido para quem quer inferência de IA sem complexidade excessiva:

  • Compatibilidade OpenAI API: drop-in replacement para a maioria dos casos de uso, sem reescrever integrações
  • Modelos open-weight populares: Llama 3, Mistral, modelos de embedding - sem depender de modelos fechados
  • Pay-per-token: sem comprometimento de instância ou pagar por GPU ociosa
  • Data centers europeus: vantagem de latência para usuários na Europa e no Brasil comparado com us-east-1
  • Preços competitivos: historicamente a Hetzner prática preço abaixo do mercado para infra equivalente

A plataforma também permite criar instâncias dedicadas de GPU para workloads que precisam de throughput alto e latência consistente, diferente do modelo serverless de inferência compartilhada.

⚠️
Atenção

O Hetzner Inference ainda e relativamente novo e o catalogo de modelos disponível e menor do que o de plataformas como Together AI ou Replicate. Verifique se o modelo que você precisa esta disponível antes de planejar uma migração.

Como começar: acesso passo a passo

Para começar a usar o Hetzner Inference, você precisa de uma conta Hetzner. Se já tem um servidor ou VPS deles, a mesma conta funciona.

# 1. Criar conta em console.hetzner.com
# 2. Acessar a secao Inference na Cloud Console
# 3. Gerar uma API Key na secao de tokens

# 4. Testar via curl
curl https://api.hetzner.cloud/inference/v1/chat/completions \
  -H "Authorization: Bearer SEU_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta-llama/Meta-Llama-3.1-8B-Instruct",
    "messages": [{"role": "user", "content": "Ola! Qual e a capital do Brasil?"}]
  }'

Para usar com o SDK Python da OpenAI, a mudança e mínima:

pip install openai

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hetzner.cloud/inference/v1",
    api_key="SEU_HETZNER_TOKEN"
)

resposta = client.chat.completions.create(
    model="meta-llama/Meta-Llama-3.1-8B-Instruct",
    messages=[{"role": "user", "content": "Explique o que é RAG em 3 frases"}]
)
print(resposta.choices[0].message.content)

Exemplo prático: RAG simples com Hetzner Inference

Um caso de uso concreto e construir um sistema de RAG (Retrieval-Augmented Generation) para responder perguntas sobre documentos internos. Com o Hetzner Inference, você pode rodar tanto o modelo de embedding quanto o modelo de geração no mesmo provedor:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hetzner.cloud/inference/v1",
    api_key="SEU_TOKEN"
)

# 1. Gerar embedding do documento
embedding = client.embeddings.create(
    model="nomic-ai/nomic-embed-text-v1.5",
    input="Texto do documento a ser indexado"
)
vector = embedding.data[0].embedding

# 2. Buscar no vector store e gerar resposta
contexto = buscar_no_vector_store(vector)
resposta = client.chat.completions.create(
    model="meta-llama/Meta-Llama-3.1-70B-Instruct",
    messages=[
        {"role": "system", "content": f"Contexto: {contexto}"},
        {"role": "user", "content": "Qual e a política de ferias da empresa?"}
    ]
)

Todo o pipeline roda em infraestrutura europeia da Hetzner, com controle total sobre quais dados saem da sua aplicação e para qual provedor.

Comparação com alternativas

O mercado de inferência de IA em nuvem esta cheio de opcoes. Onde o Hetzner se posiciona:

vs. OpenAI API: a OpenAI tem os modelos mais capazes (GPT-4o, o1), mas preço mais alto e modelos fechados. O Hetzner oferece modelos open-weight com preço potencialmente menor e sem lockin de modelo.

vs. Together AI / Replicate: ambos oferecem catalogo maior de modelos open-source. O Hetzner pode ganhar em preço e latência para usuários europeus, mas perde em variedade de modelos por enquanto.

vs. self-hosted Ollama: Ollama na sua VPS Hetzner e a opcao mais barata para volume alto, mas exige gerenciamento da instância, das atualizações e do scaling. O Hetzner Inference abstrai tudo isso.

vs. AWS Bedrock / Azure OpenAI: AWS e Azure tem ecossistema mais amplo e integrações corporativas, mas preço e complexidade são significativamente maiores. Para startups e projetos independentes, o Hetzner e mais acessível.

Pontos positivos e limitações

O Hetzner Inference tem pontos fortes claros para o público certo: preço competitivo, compatibilidade com API OpenAI e a reputação de confiabilidade da Hetzner em infraestrutura. Para equipes europeias com requisitos de residência de dados, ter os servidores na Alemanha ou Finlândia e um diferencial relevante para conformidade com GDPR.

As limitações são reais neste momento:

  • Catalogo de modelos ainda menor que concorrentes especializados em inferência
  • Documentação em fase inicial, menos exemplos e tutoriais que AWS ou Azure
  • Modelos de ponta como GPT-4o ou Claude Opus não estão disponíveis (eles são fechados)
  • Suporte e SLA ainda não tao maduros quanto os hiperescaladores para uso enterprise
🚀
Pro tip

Para projetos que precisam de fallback entre provedores, use o LiteLLM como proxy. Você configura Hetzner como provedor primário por custo e OpenAI como fallback, com roteamento automático quando o modelo não esta disponível.

Casos de uso reais

Startups de software com usuários europeus: requisitos de GDPR ficam mais simples quando os dados processados ficam em servidores na Alemanha ou Finlândia. O Hetzner Inference permite cumprir a regulamentação sem pagar premium por isso.

Desenvolvedores independentes e freelancers: API económica para adicionar funcionalidades de IA a projetos sem comprometimento mensal mínimo. Paga apenas pelo que usa.

Equipes que querem evitar lockin: como a API e compatível com OpenAI, e fácil testar o Hetzner em paralelo com outros provedores e migrar conforme necessidade, sem reescrever a integração.

Projetos de RAG e embeddings: ter modelo de embedding e modelo de geração no mesmo provedor simplifica a arquitetura e o billing de um pipeline completo de RAG.

Dicas e boas práticas

💡
Dica

Comece pelo modelo 8B para desenvolvimento e testes. Só escale para 70B quando a qualidade do 8B não for suficiente para o seu caso de uso. A diferença de custo e significativa.

💡
Dica

Ative o streaming (parâmetro stream: true) para respostas longas. Melhora muito a percepção de velocidade na interface do usuário, mesmo que o tempo total de geração seja o mesmo.

🚀
Pro tip

Para volume alto de requisições, calcule se uma instância GPU dedicada na Hetzner (Cloud GPU) com Ollama não sai mais barato do que o modelo pay-per-token. Para mais de algumas centenas de milhares de tokens por dia, a conta pode fechar melhor com instância própria.

⚠️
Atenção

Monitore o uso de tokens ativamente, especialmente no inicio. Bugs em loops de agentic AI podem gerar volume inesperado de requisições. Configure alertas de billing desde o primeiro dia.

Vale a pena?

Para devs que já usam Hetzner e querem adicionar IA sem abrir nova conta em outro provedor: sim, faz muito sentido consolidar. A integração e simples e o billing fica centralizado.

Para equipes europeias com requisitos de GDPR: o Hetzner Inference oferece uma combinação difícil de encontrar: preço acessível com infraestrutura na Europa, sem depender dos termos de privacidade das big techs americanas.

Para quem esta avaliando hoje: o próximo passo e criar uma conta gratuita em console.hetzner.com, acessar a secao de Inference e fazer os primeiros testes com o modelo Llama 3 8B. O custo de experimentar e praticamente zero, e a compatibilidade com a API da OpenAI garante que você não precisa de nenhuma mudança no seu código existente para testar.