Ensayos y notas
Ideas sobre AI, sistemas y
software que funciona en el mundo real.
Escribo sobre fronteras de decisión, agentes LLM en producción y desarrollo financiero accidental.
Últimas notas
Ver todas-
Lo que se rompe cuando el loop trabaja solo (parte 2)
Cuatro fallos medidos operando una agent box 24/7: credenciales que se pisan, errores que el móvil no enseña, el OOM-killer y la doctrina ganado-no-mascotas.
-
Una agent box: donde viven tus loops de agentes (parte 1)
El loop engineering necesita un sitio donde vivir: una agent box en tu server —demonio saliente, motor de worktrees propio y acceso sin abrir puertos.
-
El rol ya no es el puesto: cinco arquetipos para equipos con agentes
Cuando el agente absorbe la ejecución, lo que te diferencia deja de ser tu puesto —ingeniero, diseño, PM— y pasa a ser tu postura en el ciclo de vida del producto.
-
Loop engineering: el bucle del que no formas parte
Loop engineering no es 'diseña loops, no prompts'. Son tres decisiones: cuándo subir o bajar un bucle, cómo soltarlo, y qué tool le falta para cerrarse.
-
La escalera de verificación: cuando el dominio escribe su código
Cuando el dominio genera su código con IA, revisarlo no escala. La escalera de verificación: que cada afirmación la compruebe el verificador más barato.
-
Monta el benchmark de tu dominio antes que el agente
Ramp evalúa su agente contable con 237 tareas y 3.469 criterios escritos por contables. Por qué el benchmark privado de dominio decide más que el modelo.
-
Cuatro fronteras para un agente con acceso a tu contabilidad
Un agente que concilia facturas y postea al libro mayor sostiene las llaves de tu banco. Las cuatro fronteras que deciden si una inyección puede mover dinero.
-
Tu agente contable no es poco capaz, es poco fiable
El pass@1 cae de 76% a 52% según la tarea se alarga. En un agente que postea al libro mayor, ese hueco son asientos mal puestos. Capacidad no es fiabilidad.