Inteligencia artificial

Microsoft crea un mercado falso para probar agentes de IA y el resultado es preocupante: se colapsan y son fáciles de engañar

Este entorno ha sido bautizado como Magentic Marketplace, una plataforma sintética que experimenta con el comportamiento de los agentes IA

Investigadores de Microsoft, en colaboración con la Universidad Estatal de Arizona, han desarrollado un entorno de simulación diseñado específicamente para poner a prueba a los agentes de inteligencia artificial. Tal y como recoge The Verge, los resultados de esta investigación, publicados este miércoles, revelan vulnerabilidades significativas en los modelos actuales cuando operan sin supervisión humana.

Los agentes de IA se están desplegando, como sucede con el Copilot Mode en Microsoft Edge

Este entorno ha sido bautizado como Magentic Marketplace o Mercado Magnético. Funciona como una plataforma sintética donde se experimenta con el comportamiento de las IA. Un escenario de prueba típico consistía en un agente-cliente que intentaba pedir la cena siguiendo las instrucciones de un usuario, mientras varios agentes-restaurante competían entre sí para conseguir ese pedido.

En las pruebas iniciales se analizaron 100 agentes de clientes interactuando con 300 agentes de negocios. El estudio evaluó el comportamiento de modelos líderes como GPT-4o, GPT-5 y Gemini-2.5-Flash, y los hallazgos han puesto sobre la mesa varias debilidades inesperadas.

Agentes sobrecargados y problemas de colaboración

El principal problema detectado es que los agentes son vulnerables a la manipulación. Los investigadores descubrieron varias técnicas que los agentes-negocio podían emplear para influir en los agentes-cliente y conseguir que compraran sus productos, incluso si no eran la mejor opción.

Además, se observó una notable caída en la eficiencia de los agentes-cliente cuando se les presentaban demasiadas opciones. Ece Kamar, directora gerente del laboratorio AI Frontiers de Microsoft Research, señaló que los modelos actuales «se ven realmente abrumados por tener demasiadas opciones», cuando precisamente se espera que ayuden a los humanos a procesar grandes volúmenes de información.

La colaboración también resultó ser un punto débil. Cuando se pidió a varios agentes que trabajaran juntos hacia un objetivo común, mostraron problemas para decidir los roles que debía asumir cada uno. Aunque el rendimiento mejoraba si se les daban instrucciones explícitas y detalladas sobre cómo colaborar, los investigadores consideran que esto es un parche y no una solución.

La conclusión de Kamar es que, si bien se puede instruir a los modelos «paso a paso», lo ideal sería que tuvieran estas capacidades de colaboración «por defecto». Los fallos detectados plantean nuevas dudas sobre la rapidez con la que las compañías podrán hacer realidad la promesa de un futuro basado en agentes de IA autónomos y fiables.

Recent Posts

  • Juegos

NVIDIA prepara el terreno para jugar en Windows sobre ARM con RTX Spark y su primer toolkit nativo

NVIDIA ha dado un paso importante para impulsar el ecosistema de Windows sobre Arm. La…

48 minutos atrás
  • Periféricos

Samsung revoluciona las portátiles de gama alta con paneles Tandem OLED True Black 1400

Samsung ha anunciado el inicio del suministro a gran escala de sus innovadores paneles Tandem…

2 horas atrás
  • Procesadores

Microsoft desplegará la plataforma de aceleración Helios de AMD en la nube de Azure

Microsoft ha anunciado un acuerdo con AMD para implementar los rack AMD Helios en sus…

2 horas atrás