
L’intelligence artificielle est-elle sur le point de voler tous nos emplois ? Certaines entreprises misent sur cette possibilité, tandis que d’autres refusent même de lui reconnaître de telles capacités. Mais quelle est la réalité ? Dans une étude en prépublication sur arXiv, des chercheurs de l’université Carnegie Mellon ont simulé une entreprise et engagé des agents d’intelligence artificielle pour la faire fonctionner. Le résultat est loin d’être positif.
Les employés virtuels étaient des agents basés sur Claude d’Anthropic, GPT-4o d’OpenAI, Google Gemini, Amazon Nova, Meta Llama et Qwen d’Alibaba. Ils se sont vu attribuer différents rôles, comme analyste financier, chef de projet ou ingénieur logiciel. Parallèlement, les chercheurs ont utilisé une autre plateforme pour simuler les collègues qu’ils devaient contacter pour certaines tâches, comme un service des ressources humaines.
Les agents ont échoué à plus des trois quarts des tâches
Les agents devaient accomplir diverses missions, comme naviguer dans différents fichiers pour analyser une base de données ou effectuer plusieurs visites virtuelles afin de choisir de nouveaux locaux. Claude 3.5 Sonnet est arrivé largement en tête, mais cet agent n’a réussi à accomplir que 24 % des tâches. En prenant également en compte les tâches partiellement réalisées, son score n’atteignait que 34,4 %.
Gemini 2.0 Flash est arrivé deuxième, mais n’a réussi à accomplir que 11,4 % des tâches. Aucun autre agent n’a dépassé les 10 %. En revanche, en termes de coût d’utilisation, Claude 3.5 Sonnet a coûté 6,34 dollars, contre seulement 0,79 dollar pour Gemini 2.0 Flash.
Les chercheurs ont indiqué que les agents échouaient souvent à comprendre la partie implicite des instructions. Par exemple, lorsqu’on leur demandait d’enregistrer le résultat dans un fichier portant l’extension « .docx », ils ne déduisaient pas nécessairement qu’il s’agissait d’un format Microsoft Word. Ils échouaient également à certaines tâches en raison d’un manque de compétences sociales.
Mais l’un des principaux problèmes est apparu lorsqu’ils devaient naviguer sur le Web, notamment lorsqu’ils étaient confrontés à des fenêtres contextuelles. Et parfois, lorsqu’ils se perdaient, ils prenaient des raccourcis pour contourner la partie difficile de la tâche, tout en considérant avoir réussi.
Ces résultats montrent que, même si l’IA peut être extrêmement performante dans certaines tâches très spécifiques, elle est encore loin d’être capable de fonctionner de manière totalement autonome.
Source: Yahoo Finance – Read the original Article
