Cómo Desplegar y Ejecutar Llama 3 en un VPS Barato con Ollama y Docker (Guía 2026)
Guía práctica para levantar tu propia API privada de Llama 3 8B en un VPS económico utilizando Ollama, Open WebUI y Docker Compose con HTTPS.

1. Requisitos Mínimos de Hardware y Elección del VPS
Para ejecutar Llama 3 8B cuantizado en 4 bits (Q4_K_M) con velocidades de 20-30 tokens/segundo en CPU pura, necesitas al menos 4 vCPUs AMD EPYC o Ryzen y 8 GB de RAM con discos NVMe.
AlphaVPS
Procesadores AMD Ryzen 5950X / 7950X con 10% descuento de por vida
Enlace de afiliado: recibimos una comisión si contratas, sin coste adicional para ti.
2. Archivo Docker Compose para Ollama + Open WebUI
Crea una carpeta en tu servidor y pega la configuración completa de Docker Compose:
version: '3.8'
services:
ollama:
image: ollama/ollama:latest
container_name: nexalabs-ollama
restart: unless-stopped
ports:
- "11434:11434"
volumes:
- ./ollama_data:/root/.ollama
environment:
- OLLAMA_KEEP_ALIVE=24h
- OLLAMA_NUM_PARALLEL=4
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: nexalabs-webui
restart: unless-stopped
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://ollama:11434
volumes:
- ./webui_data:/app/backend/data
depends_on:
- ollama3. Descarga del Modelo y Prueba de la API
Ejecuta el siguiente comando para levantar los servicios y bajar el modelo optimizado:
# Levantar los contenedores en segundo plano
docker compose up -d
# Descargar Llama 3 (8B) optimizado
docker exec -it nexalabs-ollama ollama run llama3
# Probar la API compatible con OpenAI desde curl
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3",
"messages": [{"role": "user", "content": "Explica la computación cuántica en una frase"}]
}'Preguntas Frecuentes (FAQ)
¿Cuánto cuesta mantener este servidor al mes?
En proveedores como AlphaVPS o Hostinger VPS, una máquina con 8 GB de RAM cuesta entre 7€ y 12€/mes, sin límites de tokens ni costes por llamada.