ZAX ZAX
Ingeniería IA 9 min de lectura

Orchard se revisó discretamente el 30 de julio y sus cifras de benchmark cambiaron

Eric Leroy
Racks de servidores con luces azules en un pasillo de centro de datos

Orchard, el framework open source de modelado de agentes de Microsoft Research, no es nuevo: el artículo se presentó el 14 de mayo de 2026. Lo nuevo es que fue revisado por última vez el 30 de julio de 2026, y esa revisión movió las cifras destacadas. La entrada del blog y casi toda la cobertura siguen citando los resultados de mayo. Si evalúas frameworks de agentes con benchmarks publicados, probablemente estés comparando valores ya superados.

Qué es realmente Orchard

El problema que Orchard aborda es concreto, y lo reconocerá cualquiera que haya intentado reproducir un artículo sobre agentes. Construir sistemas agénticos punteros exige por lo general una infraestructura propietaria: entornos aislados a medida, tuberías de entrenamiento cerradas y conjuntos de datos a los que la mayoría de los equipos no puede acceder ni reproducir. El resultado es un campo donde los resultados publicados son difíciles de verificar y aún más de continuar.

En el centro del framework está Orchard Env, descrito como un servicio de entorno ligero y nativo de Kubernetes. En lugar de entregar un agente con sus propias decisiones, expone primitivas genéricas: ciclo de vida del entorno aislado, ejecución de comandos, entrada/salida de ficheros, política de red, una API REST e inyección ligera de agentes. Conviene leer esa lista despacio, porque es en esencia la capa de infraestructura que cada equipo reconstruye por su cuenta en cuanto ejecuta agentes a cierta escala.

Sobre esa base se incluyen tres dominios especializados: Orchard-SWE para ingeniería de software, Orchard-GUI para navegación web y Orchard-Claw para tareas de asistente personal.

Las cifras que cambiaron

Este es el punto en el que hay que ser preciso, porque circulan dos conjuntos de cifras y ambos son reales.

La versión de mayo informaba de 64,3 % en SWE-bench Verified tras ajuste supervisado, y 67,5 % tras SFT más aprendizaje por refuerzo. Son las cifras de la entrada de Microsoft Research y de casi todos los artículos escritos sobre Orchard desde entonces.

La revisión del 30 de julio informa de 69,7 % con aprendizaje por refuerzo basado en RPR, y 73,0 % con reordenación por modelo de valor, sobre una base Qwen3.5-35B-A3B. Es un salto de más de cinco puntos en el mismo benchmark, del mismo equipo, en un artículo con el mismo identificador de arXiv.

Los otros dos dominios están documentados con la misma precisión en la revisión: 68,4 % de éxito medio en WebVoyager, Online-Mind2Web y DeepShop para el agente GUI, y 59,6 % de pass@3 en Claw-Eval, que sube al 73,9 % al combinarlo con el ZeroClaw más potente. Los presupuestos de entrenamiento merecen mención por lo modestos: 0,4K trayectorias destiladas y 2,2K tareas abiertas para el trabajo de GUI, y 0,2K tareas sintéticas para Claw.

Por qué una revisión silenciosa importa más de lo que parece

Un preprint revisado no abre titulares. No hay nota de prensa para una v2, no hay entrada de changelog en la mayoría de los feeds y la URL no cambia. El artículo simplemente mejora mientras internet sigue citando la versión que leyó tres meses antes.

Para quien elige un framework apoyándose en benchmarks publicados, eso es una trampa real, y funciona en ambos sentidos: puedes infravalorar un framework que ha mejorado, o comparar dos sistemas cuyas cifras se midieron en condiciones y fechas distintas. El hábito útil no tiene nada de espectacular: consultar el historial de envíos en arXiv antes de citar un benchmark, y no solo el resumen.

Lo que nos llevamos

Dos cosas, dichas sin rodeos. Primero, la aportación interesante aquí no es la puntuación sino Orchard Env: un sustrato abierto y nativo de Kubernetes para ejecutar agentes en aislamiento es justo la pieza que le falta a la mayoría de los equipos, y la que suele reconstruirse mal de puertas adentro. Segundo, las cifras de benchmark en preprints que se mueven rápido tienen una caducidad que se mide en semanas.

Si construyes agentes que tocan sistemas reales, la cuestión del entorno aislado va antes que la del modelo. Es en ese orden en el que estos problemas aparecen.

Fuentes

Orchard: An Open-Source Agentic Modeling Framework, arXiv 2605.15040, presentado el 14 de mayo de 2026, última revisión el 30 de julio de 2026. Blog de Microsoft Research, Orchard: An open framework for scalable agentic AI.

Artículos relacionados