Saltar al contenido
JaviTech.

Tu agente de IA local se queda sin contexto: estos ajustes lo arreglan

27 de septiembre de 2026 · Almacenamiento y NAS

Tu agente de IA local se queda sin contexto: estos ajustes lo arreglan

🛠️ Tienes un modelo de IA corriendo en tu propio PC y, a la primera tarea seria, se queda sin contexto. ¿Te suena? Casi nunca es culpa del modelo: es de la configuración.

Desde XDA lo vivieron con Eigent, un agente de código abierto conectado a LM Studio. Le pidieron un trabajo de varios pasos y todos los subtemas volvieron con «Context size has been exceeded».

El motivo: los runners locales traen ventanas ridículas de fábrica. LM Studio arranca en 2.000-4.000 tokens, Ollama baja a 4.000 en tarjetas de menos de 24 GB (cuando su propia documentación pide 64.000 para agentes) y llama.cpp anda por lo mismo. Con eso, cualquier agente que lea archivos se ahoga.

Lo que a él le funcionó:
• Subir la ventana de contexto (se fija al cargar el modelo; ojo con tu VRAM).
• Cuantizar la caché KV a Q8_0 (K y V) con Flash Attention activado.
• Dejar el modo «thinking» desactivado: los tokens de razonamiento también gastan contexto.
• Elegir bien el cuantizado (Q4_K_M suele ser el equilibrio) y dejar ~1,5 GB de margen libre.
• Ajustar el offload a GPU hasta dar con el punto dulce.

Resultado: el agente completó las seis fases sin un solo error de contexto. Sigue tardando unos 14 minutos en un equipo modesto, pero funciona.

👉 ¿Tienes agente local montado? ¿Qué ajustes usas tú?

📰 Vía @XDA Developers: https://www.xda-developers.com/stopped-my-local-llm-agent-from-running-out-of-context/

#IA #LLM #IAenLocal #Tips #JaviTech

Artículo publicado originalmente en javitech.top el 27 de septiembre de 2026. Se conserva íntegro, solo ha cambiado el diseño que lo rodea.