Apple Silicon e IA local: por que o Mac Mini virou servidor de LLM
O Mac Mini com chip M4 virou referência para inferência de IA local. Entenda por que a arquitetura Apple Silicon e tao boa para LLMs e como começar a usar.
O Mac Mini com chip M4 virou referência para inferência de IA local. Entenda por que a arquitetura Apple Silicon e tao boa para LLMs e como começar a usar.
GLM-Z1-Flash e um modelo de IA open source da Zhipu AI que roda em computadores com pouca VRAM. Veja como instalar, configurar e usar localmente sem precisar de GPU cara.
Groq oferece inferência de LLMs em velocidades de centenas de tokens por segundo usando chips LPU próprios. Neste post, veja como funciona, como usar a API gratuita e quando faz sentido usar Groq no lugar de outras opcoes.
O DeepSeek liberou o código-fonte do DSpark, conjunto de otimizações de inferência que acelera a geração de tokens em 60 a 85% comparado ao baseline. Entenda o que muda, como funciona e por que isso importa para quem roda modelos locais.
A OpenAI revelou seu primeiro chip de IA personalizado, desenvolvido em parceria com a Broadcom. Entenda como essa jogada muda a dependência da Nvidia, o que significa para o ecossistema de desenvolvimento e o que esperar dos próximos modelos.
ONNX Runtime, TorchServe, Triton Inference Server, latência P99, autoscaling e custo. Como servir modelos de ML com SLA de produção em escala.