6 de agosto de 20265 min de lectura

Guía para Instalar DeepSeek-R1 en tu Ordenador (Windows y Mac)

Compartir
Logo de DeepSeek, un chatbot basado en inteligencia artificial para realizar búsquedas avanzadas en sistemas locales

🔄 Reescrito en agosto de 2026

La versión original de este artículo, de enero de 2025, explicaba la instalación de DeepSeek.

He reescrito la guía entera con el camino actual, que además es mucho más corto: Ollama.

DeepSeek es una familia de modelos de IA de código abierto de la empresa china homónima. DeepSeek-R1 es su modelo de razonamiento: en vez de responder de inmediato, escribe primero su cadena de pensamiento y luego contesta, lo que lo hace fuerte en matemáticas y programación y notablemente más lento en todo lo demás.

En este artículo vas a levantarlo en local, en Windows o en Mac, sin depender de ningún servicio externo y sin que tus datos salgan de tu máquina.


Primero lo importante: qué modelo te cabe

Este es el paso que casi todas las guías se saltan, y es el que decide si la experiencia va a ser buena o frustrante.

El DeepSeek-R1 “de verdad” tiene 671 mil millones de parámetros y necesita del orden de cientos de gigas de VRAM repartidos en varias GPU. En un portátil no entra, y no hay truco que lo arregle.

Lo que sí corre en un equipo normal son las destilaciones: modelos más pequeños (Qwen, Llama) entrenados para imitar el razonamiento de R1. Son los que usa todo el mundo, y son los que instala Ollama por defecto.

Modelo VRAM / RAM aproximada Equipo típico
deepseek-r1:1.5b ~4 GB Casi cualquier portátil reciente
deepseek-r1:7b ~5 GB GPU de gama media (RTX 4060), Mac con 16 GB
deepseek-r1:14b ~9-10 GB Justo en una GPU de 12 GB: baja el contexto o se queda sin memoria
deepseek-r1:32b ~18-20 GB RTX 4090 o Mac con 32 GB+
deepseek-r1:671b ~376 GB Varias GPU. Aquí no.

Sobre velocidad, para que calibres expectativas: el modelo de 32B en una RTX 4090 ronda los 40 tokens por segundo, y en una 3090 unos 30. Es cómodo para leer, pero con un modelo de razonamiento hay que sumar el rato que pasa “pensando” antes de empezar a responder.

Mi recomendación si no sabes por dónde empezar: 7b. Cabe en casi todo, responde a ritmo razonable, y si te sabe a poco siempre puedes bajar el de 14B después — los modelos conviven sin estorbarse.

En Mac con Apple Silicon la memoria es unificada, así que la columna de VRAM se lee como RAM total: con 16 GB vas cómodo hasta el de 7B, y con 32 GB llegas al de 32B.


Instalación

1. Instala Ollama

Ollama es la forma más simple de correr modelos en local: se encarga de descargar los pesos, gestionar la memoria y exponer una API. Hay instalador gráfico para Windows y para Mac.

Si prefieres la terminal, en Mac con Homebrew:

brew install ollama

Y en Windows con winget:

winget install Ollama.Ollama

2. Descarga y ejecuta el modelo

Un solo comando. Ollama descarga el modelo la primera vez y lo reutiliza después:

ollama run deepseek-r1:7b

Cuando termine la descarga te deja directamente en el chat, en la terminal. Ya está: eso es todo lo que hacía falta.

Para salir, /bye. Para volver a entrar, el mismo comando de arriba, esta vez sin descarga.

3. Comprueba qué tienes instalado

ollama list

Y si quieres liberar espacio más adelante:

ollama rm deepseek-r1:7b

Usarlo con interfaz gráfica

La terminal está bien para probar, pero para el día a día se agradece una interfaz. Dos opciones que funcionan sobre la instalación que acabas de hacer:

  • Open WebUI — una interfaz tipo ChatGPT que se conecta a tu Ollama local. Guarda el historial de conversaciones y permite cambiar de modelo desde un desplegable.
  • LM Studio — una aplicación de escritorio que hace de todo: descargar modelos, chatear y servir una API. Si prefieres no tocar la terminal en ningún momento, empieza directamente por aquí en lugar de por Ollama.

Conectarlo a tu código

Aquí es donde esto se vuelve útil para programar. Ollama expone una API en http://localhost:11434, así que puedes llamarlo desde cualquier script:

curl http://localhost:11434/api/generate -d '{
  "model": "deepseek-r1:7b",
  "prompt": "Explica qué hace un debounce en JavaScript",
  "stream": false
}'

La respuesta de un modelo de razonamiento incluye su cadena de pensamiento entre etiquetas <think> antes de la respuesta final. Si vas a mostrar el resultado en una interfaz, normalmente querrás separar esas dos partes.


¿Por qué correrlo en local?

  • Privacidad real. Nada de lo que escribes sale de tu máquina. Para código de trabajo bajo NDA, o para cualquier cosa con datos de clientes, esta es la razón que importa y no admite matices.
  • Sin cuota ni suscripción. Una vez descargado, el modelo es tuyo. No hay límite de mensajes ni factura por tokens.
  • Funciona sin conexión. Después de la descarga inicial, no necesitas internet.
  • Código abierto. Los pesos están publicados bajo licencia MIT, así que puedes usarlo comercialmente y afinarlo si te hace falta.

Y para ser honesto con lo contrario: una destilación de 7B no es GPT-5 ni Claude. Es sorprendentemente capaz para su tamaño, pero si esperas la calidad de un modelo de frontera, te va a decepcionar. La comparación justa no es contra el mejor modelo de pago, sino contra no tener nada cuando estás sin conexión o no puedes mandar el código a un tercero.


Conclusión

Correr DeepSeek-R1 en local hoy son literalmente dos pasos: instalar Ollama y ejecutar un comando. La parte que de verdad requiere pensar es la primera tabla — elegir un tamaño que tu equipo aguante — porque es lo único que separa una herramienta útil de una que tarda medio minuto en cada respuesta.

Para más detalles sobre el modelo, su repositorio en GitHub tiene los benchmarks y la licencia.

Compartir