Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

a16za16za16zLos agentes de IA capaces de operar ordenadores han cruzado un doble punto de inflexión tanto en coste como en precisión, según una nueva investigación publicada por Fabrizio Serafini, socio de Andreessen Horowitz. Estos hallazgos marcan un punto de inflexión para la industria de la subcontratación de procesos de negocio (BPO, por sus siglas en inglés), ya que el coste total de ejecutar un agente de IA oscila ahora entre los 6 y los 8 dólares por hora, por debajo de los aproximadamente 10 dólares por hora de la mano de obra de BPO en el extranjero en la India, al tiempo que supera a los humanos en las pruebas de rendimiento de tareas de escritorio estándar.a16z
Según los datos de la clasificación de llm-stats.com citados en la investigación de a16z, el modelo de IA con mejor rendimiento, Claude Fable 5, alcanza ahora una tasa de finalización de tareas del 85% en la prueba de rendimiento OSWorld-Verified, que simula entornos de escritorio reales en Ubuntu, Windows y macOS. Los evaluadores humanos obtienen aproximadamente un 72% en las mismas tareas. Hace un año, el mejor modelo apenas lograba un 42%.news.futunn+1
La prueba de rendimiento evalúa si un agente puede realizar de forma independiente tareas como la navegación por el navegador, el llenado de formularios y la pulsación de botones. En entornos de producción, las empresas desarrollan sobre API directas en lugar de productos orientados al consumidor, envolviendo las capacidades del modelo en máquinas virtuales aisladas (sandboxed) con orquestación personalizada y lógica de reintento. "Los modelos no eran lo suficientemente buenos como para usarse en producción por sí solos hasta Opus 4.6 en febrero de 2026", comentó un fundador al equipo de a16z.a16z
Aun así, una tasa de finalización del 85% significa 15 fallos por cada 100 tareas, y los procesos de soporte administrativo (back-office) exigen el éxito en cada paso. Serafini enfatizó que los factores decisivos van más allá del propio modelo: mecanismos de validación, reporte de anomalías, gestión de errores y adaptación cuando, por ejemplo, el portal de un minorista rediseña su interfaz de la noche a la mañana.news.futunn+1
La comparación de costes se basa en múltiples fuentes. La inferencia de los agentes de IA cuesta aproximadamente entre 6 y 8 dólares por hora en la modalidad más cara, el procesamiento de capturas de pantalla fotograma a fotograma con modelos de frontera, con un rango práctico de entre 3 y 15 dólares según la frecuencia de las capturas, la longitud del contexto y cuánta tarea se delegue en código determinista. La mano de obra de BPO en el extranjero en la India cuesta aproximadamente entre 8 y 15 dólares por hora, según datos de precios de 2026 de Globalify, HiveDesk y 1840 & Co. Los empleados de back-office en EE. UU. cuestan entre 30 y 45 dólares por hora cuando se incluyen los beneficios y los costes indirectos.news.futunn+1
Serafini advirtió que estas cifras deben considerarse estimaciones de orden de magnitud. Los sistemas bien diseñados reservan las llamadas a modelos costosos para tareas que requieren criterio y permiten que el código determinista de bajo coste se encargue de los pasos repetitivos, lo que reduce aún más los costes combinados a lo largo de la vida útil de un flujo de trabajo.a16z
Las implementaciones en producción ya se están ejecutando a gran escala. Una plataforma de datos de bienes de consumo procesa mensualmente entre 15 y 20 millones de interacciones automatizadas en portales, utilizando agentes como una solución de respaldo autorreparable que le permitió reducir a la mitad su equipo de ingeniería de mantenimiento de raspadores de datos (scrapers). Un integrador de sistemas global ejecuta 27 flujos de trabajo activos que procesan entre 1.500 y 2.100 incidencias de TI al día.a16z
A medida que la navegación básica por la interfaz de usuario se convierte en un producto genérico en la capa del modelo, Serafini sostiene que la ventaja competitiva sostenible se ha trasladado a las capas de aplicación y contexto: comprender la terminología interna de una empresa, los formatos preferidos, las rutas de escalada y los protocolos de gestión de fallos. Un operador que ejecuta millones de tareas automatizadas al mes le dijo al equipo de a16z que ni siquiera sabe qué modelo subyacente impulsa su sistema: su proveedor cambia los modelos sin que él lo note, y su confianza radica en la capacidad constante del sistema para completar las tareas de manera fiable.news.futunn+1