El blog de Deska

¿Qué agente sigue mejor las instrucciones?

Descubre qué agente sigue mejor las instrucciones mediante pruebas técnicas comparando modelos de razonamiento y uso de herramientas en entornos locales.

· 10 min de lectura

Determinar qué agente sigue mejor las instrucciones requiere mirar más allá de las interacciones de chat simples y analizar cómo estas herramientas ejecutan tareas complejas de varios pasos en un sistema de archivos real. Para los desarrolladores, el seguimiento de instrucciones es la diferencia entre una herramienta que construye una funcionalidad y una que crea deuda técnica. Este experimento evalúa cómo diferentes entidades de IA manejan restricciones, casos de borde y requisitos arquitectónicos cuando se les dan prompts técnicos específicos.

El problema con el seguimiento de instrucciones

La mayoría de los LLM funcionan bien en entornos controlados. Sin embargo, cuando se le asigna a un agente la tarea de modificar una base de código existente, la tasa de fallo suele aumentar. Los fallos comunes incluyen ignorar reglas de formato específicas, olvidar el manejo de errores o complicar demasiado una solicitud simple.

Probar qué agente sigue mejor las instrucciones implica medir tres criterios específicos. Primero, el agente debe adherirse a las restricciones proporcionadas sin desviarse. Segundo, debe mantener el contexto de todo el proyecto. Tercero, debe utilizar correctamente las herramientas disponibles, como terminales o sistemas de archivos, para verificar su propio trabajo.

Metodología para el experimento de agentes

Para probar estas herramientas de manera justa, utilizamos un conjunto de tareas estandarizadas que van desde la refactorización de código heredado hasta la implementación de nuevos endpoints de API. Observamos cómo diferentes modelos y enfoques de interfaz manejan estas solicitudes.

  • Adherencia a las restricciones: ¿Puede el agente usar una librería específica si se le indica que evite otra?
  • Consistencia lógica: ¿Mantiene el agente las convenciones de nomenclatura de variables en varios archivos?
  • Precisión de las herramientas: ¿Verifica el agente los procesos existentes antes de iniciar otros nuevos?

Al realizar estas pruebas, el entorno importa tanto como el modelo. El uso de una herramienta como Deska nos permite ejecutar coding agents como Claude Code y Codex CLI uno al lado del otro. Esta configuración proporciona una visión clara de cómo diferentes agentes interactúan con los mismos archivos locales en tiempo real.

Comparando arquitecturas de agentes

Diferentes agentes toman diferentes caminos para cumplir con una solicitud. Algunos son altamente autónomos, mientras que otros requieren retroalimentación humana constante.

Claude Code

Claude Code se centra en el razonamiento de alto nivel y la interacción basada en la terminal. Tiende a ser muy conservador con las ediciones de archivos, a menudo resumiendo su plan antes de la ejecución. En nuestras pruebas, destaca en el seguimiento de patrones arquitectónicos complejos. Rara vez se salta pasos, aunque su minuciosidad a veces puede resultar en tiempos de ejecución más lentos en comparación con agentes más ligeros.

OpenCode y Codex CLI

Estos agentes suelen priorizar la velocidad y la modificación directa de archivos. OpenCode es particularmente eficaz cuando necesitas una implementación directa de un patrón estándar. Sin embargo, sin un prompting estricto, ocasionalmente puede pasar por alto restricciones menores mencionadas al principio de un conjunto de instrucciones largo.

Ask Deska

Dentro del espacio de trabajo del canvas, Ask Deska funciona como un coordinador. No solo escribe código; dirige el espacio de trabajo. Si le pides que configure un entorno de depuración, puede abrir terminals y browser widgets automáticamente. Esto representa un tipo diferente de seguimiento de instrucciones donde el agente entiende el flujo de trabajo físico del desarrollador en lugar de solo el texto en un archivo.

Por qué es importante un enfoque Local-First

El seguimiento de instrucciones es más confiable cuando el agente tiene acceso directo a la fuente de la verdad. Los editores basados en la nube a menudo dependen de fragmentos de tu código. Un entorno local-first garantiza que el agente vea exactamente lo que tú ves.

Cuando usas Deska, tu code and git files permanecen en tu máquina. Esto significa que el agente puede ejecutar pruebas locales para verificar si realmente siguió tus instrucciones. Si una prueba falla, el agente puede ver la salida de la terminal inmediatamente y corregir su rumbo sin intervención manual.

Resultados de las pruebas de instrucciones

En nuestra comparación, el ganador a menudo depende de la complejidad de la instrucción. Para refactorizaciones simples, OpenCode fue el más rápido. Para cambios arquitectónicos que requerían seguir un patrón de diseño específico en cinco archivos diferentes, Claude Code demostró un seguimiento de instrucciones superior.

Los flujos de trabajo más exitosos implican el uso de estos agentes como paneles especializados. Al colocar diferentes panels de agentes en un lienzo infinito, puedes comparar sus resultados para el mismo prompt. Este análisis paralelo revela que mientras un modelo puede ser mejor en lógica, otro puede ser mejor en CSS o documentación.

Gestión de sesiones de agentes

El seguimiento eficaz de las instrucciones también depende de cómo gestiones el historial de la conversación. En Deska, los agent threads te permiten realizar un seguimiento de los comandos y el contexto anteriores. Si un agente comienza a desviarse de tus instrucciones, puedes reiniciar el hilo o proporcionar un prompt de aclaración para que vuelva al camino correcto.

Monitoreo móvil y trabajo remoto

A veces comienzas una tarea de larga duración y necesitas alejarte de tu computadora. La aplicación mobile de Deska te permite monitorear el progreso de tus agentes a través de un relevo seguro. Puedes ver si el agente está siguiendo las instrucciones que le dejaste e incluso enviar una instrucción de texto rápida para corregirlo si ves que va en la dirección equivocada.

FAQ sobre el seguimiento de instrucciones de agentes

¿Qué modelo de IA sigue mejor las instrucciones de código?

Actualmente, modelos como Claude 3.5 Sonnet y GPT-4o son considerados líderes en el seguimiento de instrucciones. La efectividad a menudo depende del system prompt y de las herramientas que el agente tiene permitido usar dentro del entorno de desarrollo.

¿Cómo evito que un agente de IA ignore mis instrucciones?

El mejor enfoque es proporcionar restricciones claras en una lista y usar una herramienta que mantenga una sesión persistente. El uso de settings específicos para definir la personalidad y los límites del agente también puede ayudar a evitar que alucine o se salte pasos.

¿Puedo ejecutar múltiples agentes de IA simultáneamente?

Sí, usar un espacio de trabajo como Deska te permite ejecutar múltiples agentes en paneles separados. Esto es útil para verificar instrucciones al ver cómo dos modelos diferentes interpretan el mismo prompt complejo.

Comienza a probar agentes hoy mismo

La mejor manera de descubrir qué agente sigue mejor las instrucciones para tu flujo de trabajo específico es probarlos en tus propios proyectos. Puedes ejecutar varios agentes uno al lado del otro y ver sus procesos de razonamiento en tiempo real.

Descarga la aplicación de escritorio gratuita para Mac, Windows y Linux en /download y comienza a construir tu propio espacio de trabajo para pruebas de agentes.

💡 Ideas+🐛 BugsPropón una feature o reporta un bug