El blog de Deska

Runbooks por agente: captura el conocimiento de las 3 a. m.

Aprende a usar agentes de IA para automatizar la creación de runbooks durante incidentes de producción para preservar conocimiento operativo crítico.

· 10 min de lectura

La redacción de runbooks suele ser la última prioridad de un ingeniero de software hasta que ocurre un fallo crítico del sistema en medio de la noche. La redacción eficaz de runbooks requiere capturar los pasos exactos, el contexto y el estado del entorno necesarios para resolver un problema, pero estos detalles se pierden frecuentemente en el fragor de un incidente. Al aprovechar los agentes de IA para documentar los procesos a medida que ocurren, los equipos pueden transformar sesiones caóticas de resolución de problemas en procedimientos operativos estructurados y repetibles.

Por qué los runbooks fallan en producción

Los runbooks tradicionales suelen sufrir la degradación de la documentación. Si un manual se escribe una vez y nunca se actualiza, se convierte en una carga en lugar de un activo. El hardware cambia, las dependencias se actualizan y los protocolos de seguridad evolucionan, dejando las instrucciones antiguas obsoletas.

Cuando un desarrollador recibe un aviso a las 3 a. m., rara vez piensa en la documentación. Piensa en la restauración del servicio. Los comandos que ejecuta, los logs que sigue y las correcciones temporales que aplica suelen quedarse en el historial de la terminal. Esto crea un silo de conocimiento donde solo la persona que corrigió el error sabe cómo solucionarlo de nuevo.

El costo de la falta de documentación

  1. Aumento del tiempo medio de recuperación: sin pasos claros, cada ingeniero debe redescubrir la solución desde cero.
  2. Fatiga mental: el estrés de trabajar a ciegas durante una interrupción provoca agotamiento y errores humanos.
  3. Fricción en la incorporación: los nuevos miembros del equipo no pueden ayudar con las rotaciones de guardia porque carecen del contexto institucional almacenado en la cabeza de los ingenieros senior.

El papel de los agentes de IA en el conocimiento capturado

Los agentes de IA modernos como Claude Code o Codex CLI proporcionan una nueva forma de cerrar la brecha entre la acción y la documentación. En lugar de escribir un runbook después del hecho, un agente puede observar la sesión o incluso ejecutar los comandos bajo supervisión humana. Debido a que estos agentes pueden leer el estado actual de un repositorio y la salida de una terminal, están en una posición única para resumir lo que realmente funcionó.

Al usar agentes para esta tarea, el objetivo no es que la IA reemplace al ingeniero, sino que actúe como un escriba digital. El agente puede rastrear qué variables de entorno se verificaron, qué consultas de base de datos se ejecutaron y qué servicios se reiniciaron. Esto crea una pista de auditoría de alta fidelidad que se puede convertir en un archivo markdown con un esfuerzo mínimo.

Arquitectura de un espacio de trabajo gestionado por agentes

Para capturar eficazmente este conocimiento de las 3 a. m., el entorno de trabajo debe estar unificado. Si los logs están en una ventana, el código en otra y la terminal en una tercera, el contexto se fragmenta.

Deska proporciona un lienzo infinito donde puedes colocar terminales y editores de código uno al lado del otro. Este diseño visual no es solo para la organización, permite al usuario ver toda el área de superficie del incidente a la vez. Al ejecutar agentes de IA como paneles dentro de este espacio, el agente tiene más contexto sobre lo que el desarrollador está intentando lograr.

Comparación de herramientas para la gestión de incidentes

EnfoqueCalidad de documentaciónVelocidad de recuperaciónRetención de contexto
Wikis manualesAlta pero a menudo obsoletaLentaBaja
Historial de consolaBaja y desordenadaRápidaMedia
Sesiones con agentesAlta y estructuradaRápidaAlta
Scripts automatizadosAlta pero rígidaMuy rápidaVariable

Aunque las wikis manuales son excelentes para la arquitectura de alto nivel, estas difieren en su enfoque respecto a las notas capturadas por agentes. El agente se centra en el "cómo" de una instancia específica, que es a menudo lo que falta en la documentación general.

Ejecución de agentes en paralelo

Una técnica poderosa es ejecutar múltiples agentes simultáneamente para verificar una corrección. Dentro del espacio de trabajo de Deska, puedes abrir paneles para diferentes agentes y comparar sus sugerencias. Esto es particularmente útil cuando se solucionan problemas en sistemas distribuidos complejos donde un agente podría centrarse en la infraestructura (manifiestos de Terraform o Kubernetes) mientras otro analiza los logs de la aplicación.

Si estás lejos de tu escritorio, la aplicación móvil te permite monitorear estas sesiones activas. Esto asegura que, incluso si tienes que alejarte, el agente pueda continuar con tareas de diagnóstico de larga duración o verificaciones de estado, informando los resultados a tu teléfono a través de un relevo seguro.

Recetas estructuradas para la redacción de runbooks

Para sacar el máximo provecho de un agente durante un incidente, sigue un flujo de trabajo estructurado. Esto asegura que el resultado sea útil para futuros casos de uso.

  • Definir el alcance: usa Ask Deska para abrir los paneles relevantes y configurar el entorno.
  • Ejecutar con observación: ejecuta tus comandos de depuración. Si estás usando un panel de agente, deja que este sugiera los comandos primero.
  • Etiquetar el éxito: una vez que el sistema esté estable, pide al agente que resuma los últimos diez minutos de salida de la terminal.
  • Exportar a una nota: mueve este resumen al panel del bloc de notas.
  • Refinar: añade un título y palabras clave de búsqueda a la nota para que pueda ser encontrada en el futuro.

Este proceso convierte una corrección frenética en un activo permanente. La naturaleza local-first de la aplicación garantiza que estos logs y notas permanezcan en tu máquina, lo cual es crítico para la seguridad y el cumplimiento al manejar datos sensibles de producción.

Refinamiento de la salida del agente

Los agentes de IA son excelentes generando texto, pero requieren supervisión humana para la precisión técnica. Siempre revisa el runbook generado en busca de valores fijos como nombres de pods específicos o marcas de tiempo que deberían reemplazarse por variables. Un buen runbook debe ser lo suficientemente generalizado como para funcionar durante el próximo incidente sin grandes ediciones.

Preguntas frecuentes sobre runbooks automatizados

¿cómo automatizar actualizaciones de runbooks con ia?

Puedes automatizar las actualizaciones proporcionando al agente tu runbook existente y los logs recientes de una sesión de recuperación exitosa. El agente identifica dónde los pasos manuales difieren de los comandos reales utilizados y sugiere un cambio para la documentación.

¿pueden los agentes de ia ejecutar comandos de terminal?

Sí, agentes como Claude Code o Codex CLI pueden ejecutar comandos de shell dentro de un entorno controlado. En un espacio de trabajo como Deska, puedes monitorear estos comandos en tiempo real a medida que aparecen en los paneles de la terminal, lo que te permite detenerlos o modificarlos si es necesario.

¿dónde guardar manuales operativos de forma segura?

Los manuales deben guardarse en un repositorio con control de versiones o en una aplicación local-first para garantizar su disponibilidad durante particiones de red. Guardarlos en el mismo espacio de trabajo donde realizas el trabajo, como dentro de los datos y almacenamiento de tu herramienta local, proporciona el acceso más rápido durante una crisis.

Primeros pasos con espacios de trabajo de agentes

La transición de la documentación manual a la redacción de runbooks asistida por agentes no ocurre de la noche a la mañana. Comienza con tener las herramientas adecuadas antes de que ocurra el incidente. Al configurar un espacio de trabajo unificado, proporcionas el contexto necesario para que la IA sea efectiva.

Puedes comenzar a organizar tu conocimiento operativo hoy mismo probando el entorno por ti mismo. Descarga la aplicación para tu plataforma y comienza a construir tu primer espacio de trabajo persistente para respuesta a incidentes.

💡 Ideas+🐛 BugsPropón una feature o reporta un bug