Como Deslocar e Correr Llama 3 num VPS Barato com Ollama e Docker (Guia 2026)
Aprenda a configurar um servidor privado virtual de baixo custo (AlphaVPS / Hostinger) para correr Llama 3 8B quantizado com Docker, Nginx e proteção SSL.

1. Requisitos Mínimos de Hardware e Escolha do VPS
Para correr o modelo Llama 3 8B quantizado a 4 bits (Q4_K_M) com boa velocidade de inferência (20-30 tokens/segundo em CPU), necessita de um servidor com no mínimo 4 vCPUs modernos (AMD EPYC ou Ryzen) e 8 GB de RAM DDR4/DDR5.
AlphaVPS
Processadores AMD Ryzen 5950X / 7950X com portas de 1Gbps
Ligação de afiliado: recebemos uma comissão se contratares, sem custo adicional para ti.
2. Ficheiro Docker Compose para Ollama + Open WebUI
Crie um diretório no seu servidor Ubuntu e adicione a seguinte configuração pronta a executar:
version: '3.8'
services:
ollama:
image: ollama/ollama:latest
container_name: nexalabs-ollama
restart: unless-stopped
ports:
- "11434:11434"
volumes:
- ./ollama_data:/root/.ollama
environment:
- OLLAMA_KEEP_ALIVE=24h
- OLLAMA_NUM_PARALLEL=4
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: nexalabs-webui
restart: unless-stopped
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://ollama:11434
volumes:
- ./webui_data:/app/backend/data
depends_on:
- ollama3. Descarregar o Modelo e Testar a API
Execute o comando abaixo para iniciar os contentores e descarregar o Llama 3 com o modelo mais recente:
# Levantar los contenedores en segundo plano
docker compose up -d
# Descargar Llama 3 (8B) optimizado
docker exec -it nexalabs-ollama ollama run llama3
# Probar la API compatible con OpenAI desde curl
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3",
"messages": [{"role": "user", "content": "Explica la computación cuántica en una frase"}]
}'Perguntas Frequentes (FAQ)
Quanto custa manter este servidor ativo por mês?
Na AlphaVPS ou Hostinger, um VPS com 8GB de RAM e 4 núcleos Ryzen custa entre €7 e €12 por mês, poupando centenas de euros em chamadas de API.