Principal Services De Diffusion En Continu L'IA apprend à tricher à Q*bert d'une manière qu'aucun humain n'a jamais fait auparavant

L'IA apprend à tricher à Q*bert d'une manière qu'aucun humain n'a jamais fait auparavant



Une IA a réussi à tricher avec le meilleur de l'humanité après avoir découvert un exploit dans le jeu d'arcade classique Q*bert et l'avoir utilisé.

Alors que les précédentes itérations de l'IA jouaient correctement à Q*bert, à un moment donné de son apprentissage du fonctionnement du jeu, il découvre un exploit qui lui permet d'accumuler des points insensés. Naturellement, comme le ferait tout joueur de chasse au score, il répète le processus afin de pouvoir augmenter son score de la manière la plus efficace possible.

Vous pouvez voir l'IA se frayer un chemin autour des plates-formes dans la vidéo ci-dessous. Au début, on dirait qu'il saute sans but entre les plates-formes. Au lieu de voir le jeu progresser jusqu'au tour suivant, Q*bert se retrouve coincé dans une boucle où toutes ses plates-formes commencent à clignoter – c'est ici que l'IA peut alors se lancer dans une frénésie de score en accumulant d'énormes points.

LIRE SUIVANT: L'un des records de jeu les plus controversés a finalement été discrédité

¿Qué significa sb en la historia de Snapchat?

Comment l'IA a gagné la guerre Q*bert

Battant le record de tous les temps pour le titre, l'IA a enregistré un score incroyablement élevé grâce à sa programmation d'algorithmes de stratégie d'évolution. Les stratégies d'évolution (ES) diffèrent de l'apprentissage par renforcement (RL) habituel utilisé par l'IA traditionnelle car elle est considérée comme plus évolutive en raison de son apprentissage générationnel.

Chaque boucle d'apprentissage est appelée génération et continue sa tâche jusqu'à ce qu'une condition définie soit remplie (dans ce cas, un score élevé). À chaque génération successive, l'IA absorbe les connaissances de la génération précédente et parvient donc mieux à atteindre le même objectif et à le dépasser. Continuez et vous vous retrouverez avec une IA absolument inégalée dans sa tâche. C'est exactement ce qui s'est passé ici avec le score Q*bert.

Décrit dans le papier , publié la semaine dernière par des chercheurs de l'Université de Fribourg, en Allemagne, il semble que le bogue n'était pas une quantité connue. En fait, même s'ils ne sont pas trop surpris de trouver le bogue, il est intéressant de voir comment l'IA est ensuite allée de l'avant et a appris à l'exploiter à chaque fois qu'elle jouait pour maximiser son potentiel de score.

LIRE SUIVANT: Cette intelligence artificielle a appris à maîtriser Super Mario Bros

Pour trouver le bogue, l'agent a d'abord dû apprendre à presque terminer le premier niveau - cela n'a pas été fait en une fois mais en utilisant de nombreuses petites améliorations, ont expliqué les chercheurs à Le registre . Nous soupçonnons qu'à un moment donné de la formation, l'une des solutions de progéniture a rencontré le bogue et a obtenu un score bien meilleur par rapport à ses frères et sœurs, ce qui a à son tour augmenté sa contribution à la mise à jour – son poids était le plus élevé de la moyenne pondérée. Cela a lentement déplacé la solution dans l'espace où de plus en plus de descendants ont commencé à rencontrer le même bogue.

Nous ne connaissons pas les conditions précises dans lesquelles le bug apparaît ; il est possible qu'il n'apparaisse que si l'agent suit un schéma qui semble sous-optimal, [par exemple lorsque l'agent perd du temps, voire perd une vie]. Si tel était le cas, il serait alors extrêmement difficile pour le RL standard de trouver le bogue : si vous utilisez des récompenses incrémentielles, vous apprendrez des stratégies qui rapportent rapidement une certaine récompense, plutôt que des stratégies d'apprentissage qui ne rapportent pas beaucoup de récompenses pendant un certain temps et puis soudainement gagner gros.

Voir connexes Le champion de dragster Todd Rogers vient de perdre sa couronne après 35 ans Cette intelligence artificielle apprend à maîtriser Super Mario Bros 1-2 depuis 17 jours Regardez cette IA apprendre à conduire dans GTA V sur Twitch

Cependant, malgré les merveilleux résultats du bot, les chercheurs ne disent pas que c'est un cas pour défendre l'apprentissage ES sur RL. En fait, les deux systèmes ont leurs propres problèmes et une combinaison des deux est largement considérée comme la meilleure option pour aller de l'avant.

La même méthode ES sur d'autres jeux Atari n'a pas donné les mêmes résultats positifs. D'autre part, RL est responsable d'avoir battu des records à gauche, à droite et au centre, notamment en battant le meilleur joueur de GO du monde. ES a toujours sa place dans les choses, et c'est en fait la façon dont Nvidia effectue une grande partie de sa formation en IA car elle nécessite plus de puissance de calcul mais obtient de meilleurs résultats sur une plus longue période de temps.

Quelle que soit la voie qui deviendra l'avenir du développement de l'IA, au moins ce bot qui trompe le système n'est pas aussi mauvais que cela champion du monde de jeu vidéo désormais en disgrâce .

Des Articles Intéressants

Choix De L'Éditeur

Rumeurs sur la date de sortie de la PS5: Quand Sony lancera-t-il sa prochaine console?
Rumeurs sur la date de sortie de la PS5: Quand Sony lancera-t-il sa prochaine console?
En mai, le PDG de Sony Interactive, John Kodera, a déclaré que la PS4 entrait dans la fin de son cycle de vie. Les pensées ont naturellement pivoté vers une nouvelle console, vraisemblablement appelée PS5. Kodera a laissé entendre que la PS5
Google Chrome 68 est sorti, marque les sites HTTP comme «non sécurisés»
Google Chrome 68 est sorti, marque les sites HTTP comme «non sécurisés»
Le navigateur Web le plus populaire, Google Chrome 68, a atteint la branche stable et est maintenant disponible pour Windows, Linux, Mac et Android.
Quinto Black CT v3.1: Design mis à jour, nouvelles fonctionnalités
Quinto Black CT v3.1: Design mis à jour, nouvelles fonctionnalités
Winamp est l'un des lecteurs multimédias les plus populaires disponibles pour Windows. Un de mes skins préférés pour Winamp, la version 2.7 de 'Quinto Black CT' est maintenant disponible.
Archives de balises: 0x80240031
Archives de balises: 0x80240031
Test de l'Asus Transformer 3 Pro: jouer à la Surface Pro 4 à son propre jeu
Test de l'Asus Transformer 3 Pro: jouer à la Surface Pro 4 à son propre jeu
Il n'y a pas de prix pour deviner qui Asus défie avec le Transformer 3 Pro. Avec sa béquille réglable, son clavier folio et sa conception 2-en-1, c'est l'image crachée de la Surface Pro 4 de Microsoft. Asus est clairement
Comment arrêter l'hébergement dans Parsec
Comment arrêter l'hébergement dans Parsec
Parsec est un logiciel d'accès à distance créé pour les sessions de jeu. Vous pouvez héberger une session de jeu en utilisant Parsec, et d'autres peuvent se joindre avec votre permission. Cependant, que se passe-t-il lorsque vous souhaitez arrêter l'hébergement ? Continuez à lire cet article, et
Facebook n'arrête pas de me déconnecter – que faire ?
Facebook n'arrête pas de me déconnecter – que faire ?
Facebook existe depuis plus d'une décennie maintenant, et il est difficile de se souvenir du monde qui l'a précédé. Tout le monde est tellement habitué à se connecter via Facebook, et c'est le principal outil de recherche pour trouver quelqu'un de nos jours, surtout que