Orchard: el framework abierto de Microsoft Research para entrenar y evaluar agentes de IA a escala

Orchard: el framework abierto de Microsoft Research para entrenar y evaluar agentes de IA a escala

Brain Code |

Microsoft Research ha presentado Orchard, un framework de código abierto diseñado para investigar, entrenar y evaluar sistemas de IA basados en agentes de forma escalable y con un enfoque orientado a reducir costes. Su elemento central es Orchard Env, un servicio de entorno reutilizable que permite trabajar con diferentes tipos de agentes y tareas sin tener que reconstruir la infraestructura para cada caso.

La propuesta parte de un problema concreto: desarrollar sistemas agénticos avanzados suele requerir infraestructuras propietarias, entornos aislados personalizados, pipelines de entrenamiento cerrados y conjuntos de datos que muchos investigadores y profesionales no pueden utilizar o reproducir. Orchard busca ofrecer una alternativa abierta a esa dependencia.

El framework se ha aplicado a tres ámbitos diferentes —ingeniería de software, navegación web y asistentes personales— mediante Orchard-SWE, Orchard-GUI y Orchard-Claw. Microsoft Research también publica los datos de entrenamiento y los métodos de evaluación utilizados para desarrollarlos.

Orchard Env: una capa de entorno reutilizable para diferentes agentes

La idea central de Orchard consiste en tratar el entorno de ejecución como un servicio independiente y reutilizable, en lugar de integrarlo directamente dentro de un framework de entrenamiento específico.

Orchard Env está construido sobre Kubernetes y puede crear, gestionar y eliminar miles de componentes aislados en paralelo. La misma infraestructura está diseñada para utilizarse en tareas como programación, navegación web o uso de herramientas, así como en diferentes etapas del entrenamiento y la evaluación de agentes.

Esta arquitectura permite reutilizar el entorno para actividades como:

  • generación de datos de entrenamiento;
  • destilación de datos;
  • rollouts de aprendizaje por refuerzo;
  • evaluación de modelos;
  • incorporación de nuevos benchmarks;
  • integración de nuevos sistemas de agentes o algoritmos de entrenamiento.

El objetivo es evitar que cada nuevo experimento requiera reconstruir desde cero la infraestructura subyacente.

Entrenar al agente dentro del entorno en el que se utilizará

Otro de los elementos de Orchard es su capacidad para entrenar agentes directamente dentro de diferentes harnesses o sistemas de ejecución.

Los agentes actuales no suelen funcionar únicamente como un modelo aislado. Utilizan sistemas como Claude Code, Codex u OpenClaw, que gestionan aspectos como el razonamiento multironda, el uso de herramientas y las conexiones con sistemas externos. Según Microsoft Research, las herramientas abiertas de entrenamiento suelen tener dificultades para trabajar con estos entornos con estado y múltiples procesos.

Esto puede provocar que un agente se entrene utilizando una versión simplificada del entorno y posteriormente se despliegue en otro sistema diferente.

Orchard aborda esa diferencia mediante un proxy ligero que registra como datos de entrenamiento las llamadas al modelo realizadas por el propio harness. Cada rollout se ejecuta además dentro de su propio contenedor. De este modo, el agente puede entrenarse de principio a fin dentro del mismo tipo de entorno en el que posteriormente funcionará, incluidos OpenClaw, Codex o ZeroClaw.

Orchard-SWE: agentes para ingeniería de software

Orchard-SWE es el flujo de entrenamiento desarrollado para tareas de ingeniería de software, un ámbito que exige razonamiento en múltiples pasos sobre repositorios reales, utilización de herramientas y capacidad para recuperarse de errores.

El sistema utiliza el framework Mini-SWE-Agent y se evalúa mediante SWE-bench Verified, un benchmark que mide la capacidad de un modelo para navegar por bases de código reales, diagnosticar problemas y repararlos.

Para el entrenamiento, Microsoft Research destiló 107.000 interacciones de agentes procedentes de dos modelos abiertos avanzados, MiniMax-M2.5 y Qwen3.5-397B, sobre diferentes issues de GitHub.

Uno de los métodos empleados es el denominado credit-assignment supervised fine-tuning. En lugar de descartar por completo los intentos en los que un agente no consigue resolver un problema, el sistema aprovecha las partes productivas de esas trayectorias como datos útiles de entrenamiento.

El proceso incorpora posteriormente aprendizaje por refuerzo y distintas técnicas para enriquecer las señales de entrenamiento:

  • Balanced Adaptive Rollout, orientado a aprovechar señales de éxito poco frecuentes.
  • On-policy distillation, donde un modelo profesor más potente evalúa paso a paso las decisiones del agente.
  • Process reward model, en el que un juez de IA recompensa un proceso adecuado de resolución del problema, independientemente de que las pruebas finales terminen superándose.

Finalmente, el sistema utiliza las trayectorias procedentes de 20 experimentos anteriores para entrenar un modelo de valor de 4.000 millones de parámetros, encargado de puntuar diferentes soluciones candidatas y seleccionar la mejor.

Resultados de Orchard-SWE

En SWE-bench Verified, Orchard-SWE parte de un resultado base del 61,4 %. Con Balanced Adaptive Rollout alcanza el 69,1 %, y con las técnicas de recompensa densa llega al 69,7 %.

Al incorporar el modelo de valor para reordenar las soluciones candidatas, el resultado alcanza el 73 %. El modelo utilizado tiene aproximadamente 3.000 millones de parámetros activos y, según Microsoft Research, se aproxima al rendimiento de sistemas de frontera más de diez veces mayores.

Orchard-GUI: un agente ligero para navegar por la web

Orchard-GUI traslada el mismo enfoque al ámbito de la navegación web, donde un agente debe interpretar interfaces visuales, interactuar con elementos dinámicos y completar tareas abiertas descritas mediante lenguaje natural.

En este caso, Orchard entrena un modelo visión-lenguaje de 4.000 millones de parámetros utilizando una cantidad relativamente limitada de supervisión: 400 demostraciones destiladas y 2.200 tareas abiertas de entrenamiento.

Los resultados publicados son:

  • 74,1 % en WebVoyager.
  • 67,0 % en Online-Mind2Web.
  • 64,0 % en DeepShop.
  • 68,4 % de media entre los tres benchmarks.

Microsoft Research sitúa estos resultados entre los obtenidos por los agentes web de código abierto más sólidos evaluados en estos benchmarks y señala que Orchard-GUI se mantiene competitivo frente a modelos propietarios de mayor tamaño.

Los resultados apuntan, dentro de los experimentos presentados, a que modelos abiertos relativamente pequeños pueden obtener un buen rendimiento en tareas web reales cuando se combinan con un entorno y un proceso de entrenamiento adecuados.

Orchard-Claw: agentes para tareas de productividad

La tercera aplicación del framework es Orchard-Claw, centrada en tareas propias de un asistente personal: leer y redactar correos electrónicos, gestionar calendarios, buscar información y coordinar acciones entre diferentes herramientas.

Orchard-Claw se entrena utilizando únicamente 200 tareas sintéticas. Evaluado mediante Claw-Eval, completa correctamente el 59,6 % de las tareas cuando dispone de hasta tres intentos.

Al combinarlo con el sistema de agentes ZeroClaw, el porcentaje aumenta hasta el 73,9 %.

Orchard-Claw también se entrena utilizando diferentes harnesses, entre ellos ReACT, ZeroClaw, OpenClaw y Codex, en lugar de depender de un único entorno simplificado.

Microsoft Research señala que este entrenamiento dentro de los entornos reales mejora la fiabilidad. En el caso del harness de Codex, por ejemplo, la tasa de éxito pasa del 18,6 % en el modelo sin entrenar al 51,5 % después del entrenamiento con Orchard.

Una misma infraestructura para distintos tipos de agentes

Los tres experimentos muestran usos diferentes de una misma capa de infraestructura.

Orchard-SWE se centra en ingeniería de software, Orchard-GUI en navegación web y Orchard-Claw en tareas de asistencia personal. Por debajo de ellos, Orchard Env proporciona capacidades compartidas como gestión de entornos aislados, ejecución de comandos, acceso a archivos, controles de red, API REST e integración con agentes.

El framework está pensado para soportar diferentes entornos —código, web, escritorio, móvil o herramientas de productividad— mediante una interfaz unificada.

La propuesta de Orchard consiste, por tanto, en reutilizar la infraestructura entre dominios y entre diferentes fases del proceso, desde la recopilación de datos hasta el aprendizaje por refuerzo y la evaluación final.

Reutilizar la experiencia acumulada por los agentes

Microsoft Research plantea también una posible evolución del enfoque: reutilizar las trayectorias generadas durante los procesos de entrenamiento en lugar de descartarlas una vez terminados los experimentos.

Esas trayectorias pueden convertirse en activos persistentes y, por ejemplo, destilarse en modelos de valor reutilizables. La idea es que la experiencia obtenida durante el entrenamiento pueda acumularse y ser aprovechada por generaciones posteriores de agentes.

Los resultados de Orchard-GUI también llevan a los investigadores a plantear que podría ser posible entrenar agentes web a mayor escala sin depender de grandes cantidades de datos de entrenamiento creados manualmente.

Con la publicación del servicio de entorno, los pipelines de entrenamiento, los conjuntos de datos y los métodos de evaluación, Orchard busca facilitar que la comunidad investigadora pueda construir y estudiar sistemas agénticos abiertos reutilizando una infraestructura común.

Fuente

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng y Jianfeng Gao, “Orchard: An open framework for scalable agentic AI”, Microsoft Research, 3 de agosto de 2026.

Escribir un comentario