Un harness es el programa que convierte un modelo de lenguaje en un agente de programación: le da herramientas para leer y editar ficheros y ejecutar comandos, gestiona la conversación y decide qué pedir permiso antes de hacer. Claude Code, Codex o Cursor son harness. La pregunta de este artículo es otra: cuáles funcionan bien con un modelo que corre en tu propio ordenador, sin mandar tu código a nadie y sin pagar por token.
Hay mucho donde elegir, pero el panorama ha cambiado bastante en 2026. Algunos nombres que aparecen en todas las listas ya no se mantienen, DeepSeek ha publicado su propio harness y Ollama arranca varios de ellos con un solo comando. Los datos de este artículo, versiones y estrellas incluidas, están tomados de cada proyecto a 28 de septiembre de 2026.
| Herramienta | Tipo | Licencia | Cómo usa modelos locales | Lo mejor |
| OpenCode | Terminal y escritorio | MIT | Cualquier API compatible con OpenAI; guías para Ollama, LM Studio y llama.cpp | Modo Plan de solo lectura, subagentes, permisos y LSP |
| Pi | Terminal | MIT | Cualquier API compatible con OpenAI o Anthropic; guía para llama.cpp | Mínimo y rápido: 4 herramientas y extensiones |
| Codex CLI | Terminal | Apache 2.0 | Modo --oss con Ollama o LM Studio | Sandbox y reglas de ejecución |
| Qwen Code | Terminal | Apache 2.0 | Ollama, vLLM y cualquier API compatible | Pensado para los modelos Qwen |
| Mistral Vibe | Terminal | Apache 2.0 | llama.cpp integrado, con Devstral local | Subagentes, skills y MCP |
| Crush | Terminal | FSL-1.1-MIT | Detecta solo los modelos de Ollama, LM Studio o llama.cpp | LSP y MCP; interfaz muy cuidada |
| Goose | Terminal y escritorio | Apache 2.0 | Proveedor nativo de Ollama | Extensiones MCP para todo |
| DeepSeek Harness (dsh) | Web y escritorio | MIT | Cualquier API compatible con OpenAI o Anthropic | Todo es un plugin; versión preliminar |
| Cline | VS Code, terminal y escritorio | Apache 2.0 | Ollama, LM Studio y APIs compatibles | Modos Plan y Act; prompt compacto para modelos locales |
| Kilo Code | VS Code y terminal | MIT | Los mismos proveedores que OpenCode, del que parte | OpenCode dentro del editor |
| Zed | Editor | GPL, AGPL y Apache | llama.cpp, Ollama, LM Studio y APIs compatibles | Agente integrado en un editor muy rápido |
| OpenHands | Web y terminal | MIT | LM Studio, Ollama, vLLM y SGLang | Entorno aislado completo para tareas largas |
Lo esencial
- El más completo: OpenCode. Terminal y escritorio, modo Plan de solo lectura, subagentes, permisos y guías oficiales para Ollama, LM Studio y llama.cpp.
- El más ligero: Pi. Cuatro herramientas y todo lo demás con extensiones. Rapidísimo, pero sin sistema de permisos: úsalo dentro de un contenedor.
- Dentro de VS Code: Cline, con un modo de prompt compacto pensado para modelos locales.
- Lo que manda es el modelo, no el harness. Con menos de 16 GB de VRAM, los agentes locales se quedan cortos. Con 24 GB, modelos como Qwen3.8-27B o Devstral Small 2 ya hacen trabajo útil.
- Sube el contexto. Por defecto, Ollama puede dar solo 4.096 tokens, y con eso ningún agente funciona. Los propios harness piden entre 32.000 y 64.000.
Antes de elegir: modelo, memoria y contexto
Un agente de programación pide mucho más a un modelo que un chat: tiene que llamar a herramientas con el formato exacto, leer ficheros largos y mantener el hilo durante decenas de pasos. Por eso, con modelos locales, el cuello de botella casi nunca es el harness. OpenHands lo dice en su documentación: si un modelo local no usa bien las herramientas, casi siempre es culpa del modelo.
Qué modelo cabe en tu equipo
Estos son los modelos abiertos que más se recomiendan para programar con agentes, con el tamaño que ocupan cuantizados a 4 bits, el formato habitual en local. A esa cifra hay que sumarle la memoria del contexto, que con 64.000 tokens son varios gigas más.
| Modelo | Tipo | Q4 (tamaño) | Dónde cabe |
| gpt-oss-20b | MoE de 21.000 millones | 11,6 GB | GPU de 16 GB |
| Devstral Small 2 (24B) | Denso | 14,3 GB | RTX 4090 o Mac con 32 GB |
| Qwen3.8-27B | Denso | 16,5 GB | GPU de 24 GB |
| Qwen3-Coder-30B-A3B | MoE, 3.000 millones activos | 18,6 GB | GPU de 24 GB, o CPU con 32 GB de RAM |
| Qwen3.6-35B-A3B | MoE, 3.000 millones activos | 22,1 GB | GPU de 24 GB justa o Mac con 64 GB |
| Qwen3-Coder-Next (80B) | MoE, 3.000 millones activos | 48,5 GB | Mac o PC con 64 GB o más |
| gpt-oss-120b | MoE de 117.000 millones | 63 GB | Mac con 96-128 GB o varias GPU |
Los modelos MoE, con pocos parámetros activos por token como Qwen3-Coder-30B-A3B, van sorprendentemente rápido incluso con parte del modelo en la RAM del sistema. Los densos, como Devstral Small 2 o Qwen3.8-27B, suelen razonar mejor a igual tamaño, pero necesitan caber enteros en la GPU para ir fluidos. Si dudas de qué cabe en tu equipo, llmfit lo calcula por ti.
Lo que no cabe en casa son los modelos grandes de los que más se habla: DeepSeek V4, GLM-5.3 o Kimi K2.7 pasan de los 300.000 millones de parámetros. Se pueden usar en estos mismos harness, pero a través de su API o de un servidor en la nube, no en tu GPU.
El ajuste que rompe todo: el contexto
Un agente mete en cada petición las instrucciones del sistema, la descripción de sus herramientas y los ficheros que ha leído. Eso llena rápido la ventana de contexto, y cuando no cabe, el modelo empieza a fallar las llamadas a herramientas sin avisar.
- Ollama ajusta el contexto por defecto según la VRAM: 4.096 tokens con menos de 24 GB, 32.000 entre 24 y 48 GB, y 256.000 por encima. Su propia documentación pide al menos 64.000 para agentes. Se cambia al arrancar el servidor con
OLLAMA_CONTEXT_LENGTH=64000 ollama serveo desde la aplicación, y se comprueba conollama ps. - llama.cpp necesita arrancar
llama-servercon--jinjapara que las llamadas a herramientas funcionen, y con un contexto amplio, por ejemplo-c 32768. - Para ahorrar memoria, Ollama puede comprimir la caché de contexto con
OLLAMA_KV_CACHE_TYPE=q8_0, que la reduce aproximadamente a la mitad.
Ollama tiene además un atajo muy cómodo: ollama launch configura y arranca directamente varios harness con un modelo local, entre ellos OpenCode, Pi, Codex, Claude Code, Goose y el de DeepSeek.
Los mejores en la terminal
OpenCode, el más completo
Es el harness abierto más popular, con más de 210.000 estrellas en GitHub y versiones casi a diario (la 1.18.32 salió el 21 de septiembre). Tiene una interfaz de terminal muy trabajada y aplicación de escritorio, y dos agentes que se cambian con el tabulador: Build, que trabaja, y Plan, de solo lectura, para pensar antes de tocar nada. Suma subagentes, permisos configurables, integración con LSP y plugins.
Con modelos locales se configura como cualquier API compatible con OpenAI, y su documentación tiene apartados específicos para Ollama, LM Studio y llama.cpp. Su consejo si las herramientas fallan: subir el contexto de Ollama a 16.000-32.000 tokens como mínimo.
Pi, el minimalista
El agente de Mario Zechner, hoy mantenido por Earendil, apuesta por lo contrario: solo cuatro herramientas (leer, escribir, editar y ejecutar comandos) y todo lo demás con extensiones, entre ellas un modo plan, una puerta de permisos y un sandbox de ejemplo. Su prompt de sistema es muy corto, y eso es una ventaja real con modelos locales, que tienen menos contexto que gastar.
La contrapartida es que no tiene sistema de permisos: ejecuta lo que el modelo decida con los permisos de tu usuario, y su propia documentación recomienda usarlo dentro de un contenedor o una máquina virtual. Tiene licencia MIT y una guía para llama.cpp. Si prefieres una interfaz gráfica con permisos encima, hablamos de PI-Desktop, que usa Pi por debajo.
Codex CLI
El agente de OpenAI es de código abierto (Apache 2.0) y funciona con modelos locales sin trucos: codex --oss usa Ollama o LM Studio, y se pueden añadir proveedores propios con su dirección. Su punto fuerte es el sandbox, que limita qué puede tocar el agente. Ollama recomienda darle al menos 64.000 tokens de contexto. Un detalle: envía datos de uso anónimos a OpenAI, que se desactivan en la configuración con [analytics] enabled = false.
Qwen Code
La apuesta de Alibaba para sus modelos Qwen, que son precisamente los más usados en local. Nació como una versión de Gemini CLI y ya va por su cuenta. Admite las API de OpenAI, Anthropic y Gemini y cualquier modelo local con Ollama o vLLM. Es la opción natural si vas a trabajar con Qwen3.8 o Qwen3-Coder.
Mistral Vibe
El agente de Mistral trae de serie un proveedor de llama.cpp y un modelo «Devstral (local)» ya configurado: si tienes Devstral Small 2 corriendo en llama-server, funciona sin tocar nada. Tiene subagentes, skills, MCP y permisos por herramienta. La telemetría se controla con la opción enable_telemetry de su configuración.
Crush
El agente de Charm, los creadores de algunas de las herramientas de terminal más bonitas que existen. Detecta solo los modelos de Ollama, LM Studio o llama.cpp, usa LSP para entender mejor el código y admite MCP. Dos matices: su licencia es FSL-1.1-MIT, que no es plenamente libre hasta pasados dos años de cada versión, y envía métricas de uso seudónimas, nunca los prompts, que se desactivan con una variable de entorno.
Goose
Nacido en Block y hoy en una fundación independiente, con aplicación de escritorio y de terminal. Tiene un proveedor nativo de Ollama y basa todas sus extensiones en MCP, lo que lo hace muy versátil para tareas que van más allá del código.
DeepSeek Harness (dsh)
DeepSeek publicó en agosto de 2026 su propio harness, dsh, y en poco más de un mes pasó de las 230.000 estrellas en GitHub. Tiene interfaz web (se arranca con npx @deepseek-ai/dsh web) y de escritorio, una arquitectura en la que todo es un plugin y, por debajo, la misma capa de proveedores que Pi. Acepta cualquier API compatible con OpenAI o Anthropic, así que funciona con modelos locales, y Ollama lo arranca directamente.
Aun así, es una versión preliminar: la propia DeepSeek avisa de que habrá cambios incompatibles y de que no ha pasado una auditoría de seguridad, y recomienda usarlo en una máquina virtual o un contenedor. Sus modelos, los DeepSeek V4, son demasiado grandes para una GPU doméstica, así que en local lo usarás con otro modelo.
En el editor y en entornos completos
Cline
La extensión de VS Code más popular para agentes, con más de 69.000 estrellas y versiones para terminal y escritorio. Funciona con Ollama, LM Studio y cualquier API compatible con OpenAI, y tiene los modos Plan y Act, para planificar antes de ejecutar, y soporte de MCP. Para modelos locales, su documentación pide activar «Use Compact Prompt», que reduce las instrucciones del sistema para ahorrar contexto. Orienta así la memoria: de 16 a 32 GB para modelos pequeños cuantizados, de 32 a 64 GB para los medianos y 64 GB o más para los grandes.
Kilo Code
Extensión de VS Code y agente de terminal que, según su propio README, parte de OpenCode. Es la forma de tener lo mismo que OpenCode dentro del editor, con los mismos proveedores.
Zed
El editor Zed trae su propio agente integrado, y funciona con llama.cpp, Ollama, LM Studio o cualquier servidor compatible con OpenAI. Hay que marcar en la configuración qué modelos admiten herramientas, con la opción supports_tools. Es la opción más fluida si no te casas con VS Code.
OpenHands
Más que un harness, un entorno completo: el agente trabaja dentro de un contenedor aislado con su propio sistema de ficheros, terminal y navegador, y se controla desde una interfaz web o desde la terminal. Es el más adecuado para dejar tareas largas en marcha sin riesgo para tu máquina. Su documentación para modelos locales es de las mejores: recomienda Qwen3.6-35B-A3B con 24 GB de VRAM o un Mac con 64 GB, un mínimo de 22.000 tokens de contexto (32.000 recomendados) y guías para LM Studio, Ollama, vLLM y SGLang.
Los que ya no recomendamos, y por qué
Algunos nombres siguen apareciendo en todas las listas, pero en 2026 no son buena elección para trabajar en local:
- Claude Code. Funciona con modelos locales a través de la compatibilidad de Ollama con la API de Anthropic (
ollama launch claude), pero con limitaciones: parte de sus funciones, como la búsqueda web o algunos controles de herramientas, no están disponibles, y Anthropic no da soporte a usarlo con modelos que no sean Claude. Es un harness excelente, pero pensado para Claude. - Gemini CLI. No admite modelos locales. Solo usa uno pequeño, Gemma, para decidir si mandar cada petición a Gemini Flash o a Pro, y el equipo ha dicho que no tiene planes inmediatos de abrirlo a otras API. Si te gusta, su versión alternativa es precisamente Qwen Code.
- Aider. Fue el pionero de la programación con IA en la terminal y sigue funcionando con modelos locales, pero su última versión es de agosto de 2025. Está prácticamente parado.
- Continue. Su repositorio avisa de que ya no se mantiene y está en modo de solo lectura desde la versión final de junio de 2026.
- Roo Code. Archivado desde mayo de 2026. El propio proyecto remite a Cline o a una continuación comunitaria llamada Zoo Code.
Cuál elegir
- Si empiezas y quieres que funcione a la primera: OpenCode con Ollama. Instala Ollama, sube el contexto a 64.000 tokens, descarga un modelo que quepa en tu GPU y arráncalo con
ollama launch opencode. - Si tu equipo es justo de memoria: Pi o Cline con el prompt compacto, porque gastan menos contexto en instrucciones y dejan más espacio para tu código.
- Si trabajas en VS Code: Cline, o Kilo Code si ya te gusta cómo funciona OpenCode.
- Si usas modelos de Mistral o de Qwen: Mistral Vibe con Devstral, o Qwen Code con Qwen. Están afinados para ellos.
- Si quieres dejar al agente trabajando solo: OpenHands, que lo encierra en un contenedor.
- Si quieres curiosear lo nuevo: el DeepSeek Harness, siempre dentro de una máquina virtual mientras sea una versión preliminar.
Y un consejo que vale para todos: empieza con permisos. Un modelo local se equivoca más que uno grande en la nube, y un rm mal puesto no entiende de privacidad. OpenCode, Cline, Codex o Mistral Vibe piden confirmación antes de ejecutar comandos; Pi y el DeepSeek Harness no, así que en esos casos trabaja dentro de un contenedor.
Si quieres ir más allá de la programación, en cómo montar agentes de IA locales en un PC normal explicamos cómo montar asistentes con tus propios documentos, y en agentic coding, cómo está cambiando la forma de programar.











