(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 11 min de lectura
Dimensiona una configuración de LLM local de 16GB según los pesos del modelo, la caché KV y el procesamiento de prompts. Compara los presupuestos de memoria, el ancho de banda de GPU y el coste de propiedad de Qwen3.8 27B.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 13 min de lectura
Guía práctica de octubre de 2026 para elegir modelos de IA locales para agentes de programación. Compara memoria de GPU, crecimiento de KV-cache, tamaño de contexto, calidad de cuantización, procesamiento de prompts, ajustes de razonamiento y costes de alquiler en la nube.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 13 min de lectura
Cómo los Context Language Models editan la memoria de los agentes, qué demuestran las pruebas y cómo afectan la fiabilidad los costes de caché, la capacidad del modelo y las notas no confiables.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 12 min de lectura
Ejecuta un agente de programación local con Strata y OpenCode. Examina los resultados publicados de la RTX 4060 Ti, los requisitos de RAM, la reutilización de prompts, los presupuestos de razonamiento y los límites de sustituir una suscripción de pago.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 10 min de lectura
Diagnostica respuestas inconsistentes de OpenRouter, compara límites de endpoints y costes de caché, y configura el enrutamiento sin desactivar controles de calidad por accidente.