Los mejores harness para programar con IA en local: OpenCode, Pi, DeepSeek y compañía

Rubén Castro, 28 septiembre 2026
mejores harness programar ia local

Un harness es el programa que convierte un modelo de lenguaje en un agente de programación: le da herramientas para leer y editar ficheros y ejecutar comandos, gestiona la conversación y decide qué pedir permiso antes de hacer. Claude Code, Codex o Cursor son harness. La pregunta de este artículo es otra: cuáles funcionan bien con un modelo que corre en tu propio ordenador, sin mandar tu código a nadie y sin pagar por token.

Hay mucho donde elegir, pero el panorama ha cambiado bastante en 2026. Algunos nombres que aparecen en todas las listas ya no se mantienen, DeepSeek ha publicado su propio harness y Ollama arranca varios de ellos con un solo comando. Los datos de este artículo, versiones y estrellas incluidas, están tomados de cada proyecto a 28 de septiembre de 2026.

Los harness que funcionan con modelos locales en 2026

HerramientaTipoLicenciaCómo usa modelos localesLo mejor
OpenCodeTerminal y escritorioMITCualquier API compatible con OpenAI; guías para Ollama, LM Studio y llama.cppModo Plan de solo lectura, subagentes, permisos y LSP
PiTerminalMITCualquier API compatible con OpenAI o Anthropic; guía para llama.cppMínimo y rápido: 4 herramientas y extensiones
Codex CLITerminalApache 2.0Modo --oss con Ollama o LM StudioSandbox y reglas de ejecución
Qwen CodeTerminalApache 2.0Ollama, vLLM y cualquier API compatiblePensado para los modelos Qwen
Mistral VibeTerminalApache 2.0llama.cpp integrado, con Devstral localSubagentes, skills y MCP
CrushTerminalFSL-1.1-MITDetecta solo los modelos de Ollama, LM Studio o llama.cppLSP y MCP; interfaz muy cuidada
GooseTerminal y escritorioApache 2.0Proveedor nativo de OllamaExtensiones MCP para todo
DeepSeek Harness (dsh)Web y escritorioMITCualquier API compatible con OpenAI o AnthropicTodo es un plugin; versión preliminar
ClineVS Code, terminal y escritorioApache 2.0Ollama, LM Studio y APIs compatiblesModos Plan y Act; prompt compacto para modelos locales
Kilo CodeVS Code y terminalMITLos mismos proveedores que OpenCode, del que parteOpenCode dentro del editor
ZedEditorGPL, AGPL y Apachellama.cpp, Ollama, LM Studio y APIs compatiblesAgente integrado en un editor muy rápido
OpenHandsWeb y terminalMITLM Studio, Ollama, vLLM y SGLangEntorno aislado completo para tareas largas

Lo esencial

  • El más completo: OpenCode. Terminal y escritorio, modo Plan de solo lectura, subagentes, permisos y guías oficiales para Ollama, LM Studio y llama.cpp.
  • El más ligero: Pi. Cuatro herramientas y todo lo demás con extensiones. Rapidísimo, pero sin sistema de permisos: úsalo dentro de un contenedor.
  • Dentro de VS Code: Cline, con un modo de prompt compacto pensado para modelos locales.
  • Lo que manda es el modelo, no el harness. Con menos de 16 GB de VRAM, los agentes locales se quedan cortos. Con 24 GB, modelos como Qwen3.8-27B o Devstral Small 2 ya hacen trabajo útil.
  • Sube el contexto. Por defecto, Ollama puede dar solo 4.096 tokens, y con eso ningún agente funciona. Los propios harness piden entre 32.000 y 64.000.

Antes de elegir: modelo, memoria y contexto

Un agente de programación pide mucho más a un modelo que un chat: tiene que llamar a herramientas con el formato exacto, leer ficheros largos y mantener el hilo durante decenas de pasos. Por eso, con modelos locales, el cuello de botella casi nunca es el harness. OpenHands lo dice en su documentación: si un modelo local no usa bien las herramientas, casi siempre es culpa del modelo.

Qué modelo cabe en tu equipo

Estos son los modelos abiertos que más se recomiendan para programar con agentes, con el tamaño que ocupan cuantizados a 4 bits, el formato habitual en local. A esa cifra hay que sumarle la memoria del contexto, que con 64.000 tokens son varios gigas más.

Modelos abiertos para programar en local y dónde caben (tamaños de los ficheros GGUF en Q4)

ModeloTipoQ4 (tamaño)Dónde cabe
gpt-oss-20bMoE de 21.000 millones11,6 GBGPU de 16 GB
Devstral Small 2 (24B)Denso14,3 GBRTX 4090 o Mac con 32 GB
Qwen3.8-27BDenso16,5 GBGPU de 24 GB
Qwen3-Coder-30B-A3BMoE, 3.000 millones activos18,6 GBGPU de 24 GB, o CPU con 32 GB de RAM
Qwen3.6-35B-A3BMoE, 3.000 millones activos22,1 GBGPU de 24 GB justa o Mac con 64 GB
Qwen3-Coder-Next (80B)MoE, 3.000 millones activos48,5 GBMac o PC con 64 GB o más
gpt-oss-120bMoE de 117.000 millones63 GBMac con 96-128 GB o varias GPU

Los modelos MoE, con pocos parámetros activos por token como Qwen3-Coder-30B-A3B, van sorprendentemente rápido incluso con parte del modelo en la RAM del sistema. Los densos, como Devstral Small 2 o Qwen3.8-27B, suelen razonar mejor a igual tamaño, pero necesitan caber enteros en la GPU para ir fluidos. Si dudas de qué cabe en tu equipo, llmfit lo calcula por ti.

Lo que no cabe en casa son los modelos grandes de los que más se habla: DeepSeek V4, GLM-5.3 o Kimi K2.7 pasan de los 300.000 millones de parámetros. Se pueden usar en estos mismos harness, pero a través de su API o de un servidor en la nube, no en tu GPU.

El ajuste que rompe todo: el contexto

Un agente mete en cada petición las instrucciones del sistema, la descripción de sus herramientas y los ficheros que ha leído. Eso llena rápido la ventana de contexto, y cuando no cabe, el modelo empieza a fallar las llamadas a herramientas sin avisar.

  • Ollama ajusta el contexto por defecto según la VRAM: 4.096 tokens con menos de 24 GB, 32.000 entre 24 y 48 GB, y 256.000 por encima. Su propia documentación pide al menos 64.000 para agentes. Se cambia al arrancar el servidor con OLLAMA_CONTEXT_LENGTH=64000 ollama serve o desde la aplicación, y se comprueba con ollama ps.
  • llama.cpp necesita arrancar llama-server con --jinja para que las llamadas a herramientas funcionen, y con un contexto amplio, por ejemplo -c 32768.
  • Para ahorrar memoria, Ollama puede comprimir la caché de contexto con OLLAMA_KV_CACHE_TYPE=q8_0, que la reduce aproximadamente a la mitad.

Ollama tiene además un atajo muy cómodo: ollama launch configura y arranca directamente varios harness con un modelo local, entre ellos OpenCode, Pi, Codex, Claude Code, Goose y el de DeepSeek.

Los mejores en la terminal

OpenCode, el más completo

Es el harness abierto más popular, con más de 210.000 estrellas en GitHub y versiones casi a diario (la 1.18.32 salió el 21 de septiembre). Tiene una interfaz de terminal muy trabajada y aplicación de escritorio, y dos agentes que se cambian con el tabulador: Build, que trabaja, y Plan, de solo lectura, para pensar antes de tocar nada. Suma subagentes, permisos configurables, integración con LSP y plugins.

Con modelos locales se configura como cualquier API compatible con OpenAI, y su documentación tiene apartados específicos para Ollama, LM Studio y llama.cpp. Su consejo si las herramientas fallan: subir el contexto de Ollama a 16.000-32.000 tokens como mínimo.

Pi, el minimalista

El agente de Mario Zechner, hoy mantenido por Earendil, apuesta por lo contrario: solo cuatro herramientas (leer, escribir, editar y ejecutar comandos) y todo lo demás con extensiones, entre ellas un modo plan, una puerta de permisos y un sandbox de ejemplo. Su prompt de sistema es muy corto, y eso es una ventaja real con modelos locales, que tienen menos contexto que gastar.

La contrapartida es que no tiene sistema de permisos: ejecuta lo que el modelo decida con los permisos de tu usuario, y su propia documentación recomienda usarlo dentro de un contenedor o una máquina virtual. Tiene licencia MIT y una guía para llama.cpp. Si prefieres una interfaz gráfica con permisos encima, hablamos de PI-Desktop, que usa Pi por debajo.

Codex CLI

El agente de OpenAI es de código abierto (Apache 2.0) y funciona con modelos locales sin trucos: codex --oss usa Ollama o LM Studio, y se pueden añadir proveedores propios con su dirección. Su punto fuerte es el sandbox, que limita qué puede tocar el agente. Ollama recomienda darle al menos 64.000 tokens de contexto. Un detalle: envía datos de uso anónimos a OpenAI, que se desactivan en la configuración con [analytics] enabled = false.

Qwen Code

La apuesta de Alibaba para sus modelos Qwen, que son precisamente los más usados en local. Nació como una versión de Gemini CLI y ya va por su cuenta. Admite las API de OpenAI, Anthropic y Gemini y cualquier modelo local con Ollama o vLLM. Es la opción natural si vas a trabajar con Qwen3.8 o Qwen3-Coder.

Mistral Vibe

El agente de Mistral trae de serie un proveedor de llama.cpp y un modelo «Devstral (local)» ya configurado: si tienes Devstral Small 2 corriendo en llama-server, funciona sin tocar nada. Tiene subagentes, skills, MCP y permisos por herramienta. La telemetría se controla con la opción enable_telemetry de su configuración.

Crush

El agente de Charm, los creadores de algunas de las herramientas de terminal más bonitas que existen. Detecta solo los modelos de Ollama, LM Studio o llama.cpp, usa LSP para entender mejor el código y admite MCP. Dos matices: su licencia es FSL-1.1-MIT, que no es plenamente libre hasta pasados dos años de cada versión, y envía métricas de uso seudónimas, nunca los prompts, que se desactivan con una variable de entorno.

Goose

Nacido en Block y hoy en una fundación independiente, con aplicación de escritorio y de terminal. Tiene un proveedor nativo de Ollama y basa todas sus extensiones en MCP, lo que lo hace muy versátil para tareas que van más allá del código.

DeepSeek Harness (dsh)

DeepSeek publicó en agosto de 2026 su propio harness, dsh, y en poco más de un mes pasó de las 230.000 estrellas en GitHub. Tiene interfaz web (se arranca con npx @deepseek-ai/dsh web) y de escritorio, una arquitectura en la que todo es un plugin y, por debajo, la misma capa de proveedores que Pi. Acepta cualquier API compatible con OpenAI o Anthropic, así que funciona con modelos locales, y Ollama lo arranca directamente.

Aun así, es una versión preliminar: la propia DeepSeek avisa de que habrá cambios incompatibles y de que no ha pasado una auditoría de seguridad, y recomienda usarlo en una máquina virtual o un contenedor. Sus modelos, los DeepSeek V4, son demasiado grandes para una GPU doméstica, así que en local lo usarás con otro modelo.

En el editor y en entornos completos

Cline

La extensión de VS Code más popular para agentes, con más de 69.000 estrellas y versiones para terminal y escritorio. Funciona con Ollama, LM Studio y cualquier API compatible con OpenAI, y tiene los modos Plan y Act, para planificar antes de ejecutar, y soporte de MCP. Para modelos locales, su documentación pide activar «Use Compact Prompt», que reduce las instrucciones del sistema para ahorrar contexto. Orienta así la memoria: de 16 a 32 GB para modelos pequeños cuantizados, de 32 a 64 GB para los medianos y 64 GB o más para los grandes.

Kilo Code

Extensión de VS Code y agente de terminal que, según su propio README, parte de OpenCode. Es la forma de tener lo mismo que OpenCode dentro del editor, con los mismos proveedores.

Zed

El editor Zed trae su propio agente integrado, y funciona con llama.cpp, Ollama, LM Studio o cualquier servidor compatible con OpenAI. Hay que marcar en la configuración qué modelos admiten herramientas, con la opción supports_tools. Es la opción más fluida si no te casas con VS Code.

OpenHands

Más que un harness, un entorno completo: el agente trabaja dentro de un contenedor aislado con su propio sistema de ficheros, terminal y navegador, y se controla desde una interfaz web o desde la terminal. Es el más adecuado para dejar tareas largas en marcha sin riesgo para tu máquina. Su documentación para modelos locales es de las mejores: recomienda Qwen3.6-35B-A3B con 24 GB de VRAM o un Mac con 64 GB, un mínimo de 22.000 tokens de contexto (32.000 recomendados) y guías para LM Studio, Ollama, vLLM y SGLang.

Los que ya no recomendamos, y por qué

Algunos nombres siguen apareciendo en todas las listas, pero en 2026 no son buena elección para trabajar en local:

  • Claude Code. Funciona con modelos locales a través de la compatibilidad de Ollama con la API de Anthropic (ollama launch claude), pero con limitaciones: parte de sus funciones, como la búsqueda web o algunos controles de herramientas, no están disponibles, y Anthropic no da soporte a usarlo con modelos que no sean Claude. Es un harness excelente, pero pensado para Claude.
  • Gemini CLI. No admite modelos locales. Solo usa uno pequeño, Gemma, para decidir si mandar cada petición a Gemini Flash o a Pro, y el equipo ha dicho que no tiene planes inmediatos de abrirlo a otras API. Si te gusta, su versión alternativa es precisamente Qwen Code.
  • Aider. Fue el pionero de la programación con IA en la terminal y sigue funcionando con modelos locales, pero su última versión es de agosto de 2025. Está prácticamente parado.
  • Continue. Su repositorio avisa de que ya no se mantiene y está en modo de solo lectura desde la versión final de junio de 2026.
  • Roo Code. Archivado desde mayo de 2026. El propio proyecto remite a Cline o a una continuación comunitaria llamada Zoo Code.

Cuál elegir

  • Si empiezas y quieres que funcione a la primera: OpenCode con Ollama. Instala Ollama, sube el contexto a 64.000 tokens, descarga un modelo que quepa en tu GPU y arráncalo con ollama launch opencode.
  • Si tu equipo es justo de memoria: Pi o Cline con el prompt compacto, porque gastan menos contexto en instrucciones y dejan más espacio para tu código.
  • Si trabajas en VS Code: Cline, o Kilo Code si ya te gusta cómo funciona OpenCode.
  • Si usas modelos de Mistral o de Qwen: Mistral Vibe con Devstral, o Qwen Code con Qwen. Están afinados para ellos.
  • Si quieres dejar al agente trabajando solo: OpenHands, que lo encierra en un contenedor.
  • Si quieres curiosear lo nuevo: el DeepSeek Harness, siempre dentro de una máquina virtual mientras sea una versión preliminar.

Y un consejo que vale para todos: empieza con permisos. Un modelo local se equivoca más que uno grande en la nube, y un rm mal puesto no entiende de privacidad. OpenCode, Cline, Codex o Mistral Vibe piden confirmación antes de ejecutar comandos; Pi y el DeepSeek Harness no, así que en esos casos trabaja dentro de un contenedor.

Si quieres ir más allá de la programación, en cómo montar agentes de IA locales en un PC normal explicamos cómo montar asistentes con tus propios documentos, y en agentic coding, cómo está cambiando la forma de programar.

Fuentes

  1. opencode.ai
  2. github.com
  3. github.com
  4. docs.ollama.com
  5. docs.openhands.dev
Rubén Castro

Rubén Castro

Redactor

Apasionado de explorar y diseccionar lo último en tecnología. Tengo mucha experiencia en el mundo de los ordenadores y el gaming, aunque también me gustan todos los tipos de gadgets.