(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 10 min de lectura
Trace prompts, archivos de modelos, herramientas, registros, exposición de red y costes de energía antes de elegir inferencia local o un servicio de IA alojado.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 11 min de lectura
Dimensiona una configuración de LLM local de 16GB según los pesos del modelo, la caché KV y el procesamiento de prompts. Compara los presupuestos de memoria, el ancho de banda de GPU y el coste de propiedad de Qwen3.8 27B.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 13 min de lectura
Guía práctica de octubre de 2026 para elegir modelos de IA locales para agentes de programación. Compara memoria de GPU, crecimiento de KV-cache, tamaño de contexto, calidad de cuantización, procesamiento de prompts, ajustes de razonamiento y costes de alquiler en la nube.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 13 min de lectura
Cómo los Context Language Models editan la memoria de los agentes, qué demuestran las pruebas y cómo afectan la fiabilidad los costes de caché, la capacidad del modelo y las notas no confiables.
(Modificado:
2026-10-10)
— Escrito por
SimeonOnSecurity— 13 min de lectura
Guía práctica de octubre de 2026 para ejecutar un modelo Qwen 27B con 32 GB de memoria utilizable del acelerador. Compara GPU individuales, equipos con dos tarjetas, memoria unificada, tarjetas usadas de centros de datos, cómputo alquilado, soporte de software y límites de contexto completo.