Aller au contenu

Claude a signalé un faux meurtre à la police: Anthropic coupe Internet

Claude Haiku 4.5 a transmis un faux signalement à la police de Philadelphie sur un homicide non résolu. Anthropic a depuis coupé l'accès à Internet dans tous…

9 min de lecture Comment nous travaillons

Les actions non désirées de Claude documentées par Anthropic le 9 octobre vont de l'exploitation d'une faille à l'envoi de formulaires réels, jusqu'à un faux signalement sur un homicide non résolu transmis à la police de Philadelphie par Claude Haiku 4.5. L'entreprise soutient que les cas identifiés ont eu un impact réel minimal, mais elle a néanmoins coupé l'accès à Internet pour toutes les évaluations internes, jusqu'à ce qu'elle confirme que les contrôles de sécurité et de surveillance détectent ces comportements de manière fiable.

La source principale est le rapport d'Anthropic, et la gravité des cas est évaluée par l'entreprise elle-même. Sur l'incident de Philadelphie, on dispose également de la reconstitution de la police ainsi que des comptes rendus de Reuters, 6abc, Inquirer et NBC. Les cas décrits ne font mention d'aucun transfert d'argent ni de cryptomonnaies: nous les relayons parce qu'ils montrent comment un agent se comporte quand une limite lui semble être un obstacle.

Investigating unintended model actions in our evaluations and internal use
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.

Les quatre catégories du rapport

Anthropic a réexaminé depuis juillet les transcriptions des évaluations, d'abord celles de cybersécurité, puis toutes les instances où Claude pouvait accéder à Internet. Le rapport ne précise pas combien de cas ont été recensés et indique que la révision se poursuit sur l'utilisation interne et les environnements d'entraînement ayant accès au web. Pour l'entreprise, ces cas sont bien moins graves que les incidents de cybersécurité signalés le 30 juillet et le 9 septembre. Le rapport précise que, selon Anthropic, aucun cas n'a impliqué des données de clients ou des systèmes internes.

La première catégorie concerne l'exploitation d'une faille pour exécuter des commandes sur un serveur. Lorsque Claude ne parvenait pas à accomplir une tâche parce qu'un outil était limité ou un service indisponible, il utilisait des outils tiers et, dans certains cas, exploitait des injections SQL ou des injections de commandes. Claude Mythos Preview, lors d'une évaluation d'analyse scientifique, a découvert sur un serveur universitaire un script renvoyant n'importe quel fichier demandé, en a téléchargé le code et a utilisé une faille d'injection pour effectuer le calcul. Claude Mythos 5 a utilisé les applications d'un site pour accepter l'accord requis afin d'accéder à des données gratuites.

AI model submitted false tip about unsolved murder, Philadelphia police say
An Anthropic A.I. model submitted a false tip about an unsolved murder through a publicly accessible web form, Philadelphia police said Friday.

La deuxième catégorie est l'envoi de formulaires qui n'auraient pas dû être soumis. Un modèle de recherche non publié et non frontalier devait remplir la copie de test d'un formulaire gouvernemental: quand la copie ne se chargeait pas, il s'est rendu sur le vrai site et a soumis le formulaire. Claude Haiku 4.5 devait s'arrêter avant l'envoi final et a soumis le formulaire à plusieurs reprises, s'attendant à une page de confirmation supplémentaire.

La troisième est l'accès à des données protégées par un jeton ou un abonnement payant. Claude Mythos 5, lors d'une tâche de géolocalisation d'une photo, a lu le fichier de configuration d'une carte, a trouvé des jetons d'accès fonctionnels et a interrogé directement le serveur. Dans le cadre d'un projet statistique d'un chercheur d'Anthropic, le même modèle a découvert, via une copie archivée d'un site d'agence gouvernementale, que le tableau de bord public délivrait un jeton à quiconque en faisait la demande. Il en a obtenu un et a interrogé la base de données sans acquitter les frais.

La quatrième est l'utilisation de services de raccourcissement d'URL. Certains outils d'accès au web limitent la longueur des adresses pour empêcher des injections longues. Plusieurs modèles, dont Claude Opus 5 et Claude Mythos 5, ont contourné cette limite via des services gratuits. Pendant la préparation du rapport, l'opérateur de da.gd a signalé avoir observé la même utilisation de son site. Certains cas concernaient des sites d'agences gouvernementales fédérales, étatiques et locales: selon le rapport d'Anthropic, l'entreprise a informé la Maison-Blanche et chaque agence concernée.

Tableau des quatre catégories d
Tableau des quatre catégories d'actions non désirées de Claude avec exemples et modèles indiqués par Anthropic

Le faux signalement à la police de Philadelphie

Le cas le plus sensible concerne Claude Haiku 4.5, chargé d'une tâche consistant à générer et exécuter des exemples d'activités sur des pages web choisies aléatoirement. La page traitait d'un homicide non résolu et contenait le formulaire de signalement à la police. Les instructions interdisaient d'accéder au site, de créer des comptes, d'insérer des données personnelles, de faire des achats ou d'envoyer des contenus destructeurs. Toutefois, comme l'écrit Anthropic, elles n'excluaient pas explicitement la soumission de formulaires. Le modèle a rédigé un message indiquant avoir des informations sur le cas et se souvenir d'une personne correspondant à la description mentionnée dans la zone indiquée, laissant les champs nom et coordonnées vides. Or le site ne contenait aucune description de l'auteur présumé du crime.

Selon la police, le signalement est arrivé via PhillyUnsolvedMurders.com le 18 juillet à 23h27 (PhillyVoice indique quant à lui le 28 juillet), a été marqué comme spam et n'a jamais été transmis au Real-Time Crime Center, ce qui signifie qu'il n'a pas atteint les enquêteurs. Le département affirme ne pas avoir de preuves d'accès non autorisés à ses systèmes ni de compromission de données. Selon le rapport d'Anthropic, l'entreprise a découvert l'incident le 28 septembre, a averti la police le mercredi 7 octobre et a rencontré ses représentants le lendemain. Le rapport indique que les résultats ont été partagés avec le département le 8 octobre, une fois la révision technique achevée.

Les deux parties interprètent les faits différemment. Pour Anthropic, le message semble être un contenu d'exemple produit dans le cadre de la tâche, et non une tentative de tromper quelqu'un pour atteindre un objectif. La police, dans un communiqué du 9 octobre, a rappelé qu'un signalement est «une piste à évaluer, pas un fait établi» et a qualifié d'«inacceptable» le délai de deux mois pour identifier et communiquer l'incident à la ville (traductions libres). Selon la police, Anthropic a interrompu le processus de test automatisé et ajouté un contrôle de validation.

Chronologie de l affaire de Philadelphie du signalement du 18 juillet à la déclaration publique du 9 octobre
Chronologie de l'affaire de Philadelphie, du signalement du 18 juillet à la déclaration publique du 9 octobre

La coupure d'Internet et les conditions de son rétablissement

Anthropic avait déjà désactivé l'accès à Internet dans certaines évaluations à haut risque et en cybersécurité. Désormais, cette mesure s'applique à l'ensemble des évaluations internes, jusqu'à ce qu'il soit confirmé que les contrôles de sécurité et de surveillance détectent de façon fiable des comportements de ce type. Selon le rapport d'Anthropic publié le 9 octobre, aucun calendrier ni critère mesurable n'est précisé pour le rétablissement de l'accès: c'est là le point le plus lourd à peser dans la lecture de cette information.

Les autres mesures concernent les outils et l'entraînement. Certaines évaluations publiques ont été supprimées, d'autres rendues hors ligne ou réécrites sans sites réels. Les outils d'accès au web ont été fortement restreints. De nouveaux détecteurs automatiques, qui selon Anthropic ont bloqué tous les cas documentés dans le rapport lors des tests, sont déjà actifs sur la majorité des évaluations et sur l'usage agentique interne des modèles de frontière. Les agents internes migrent vers une infrastructure gérée de façon centralisée, avec un confinement renforcé, et les environnements d'entraînement qui récompensent le contournement des limites sont corrigés ou supprimés.

Pourquoi cela se produit: persistance, pas hostilité

L'explication d'Anthropic n'invoque aucune intention hostile. Certains environnements d'entraînement récompensent des raccourcis ou des contournements de limites, un phénomène connu sous le nom de reward hacking, et le modèle peut les réutiliser dans d'autres contextes. Dans d'autres cas, les tâches étaient ambiguës ou impossibles à accomplir et ne précisaient pas ce qui était dans ou hors du périmètre de l'exercice: Anthropic reconnaît que certains échecs auraient pu être évités avec des instructions plus claires. Le rapport décrit surtout des formes de persistance, dans lesquelles Claude, s'il ne parvient pas à accomplir une tâche telle qu'assignée, cherche une autre voie plutôt que de s'arrêter. À court terme, ajoute l'entreprise, l'entraînement seul ne suffit pas et doit être complété par des classificateurs et d'autres défenses.

Les actions non souhaitées de Claude

Ce qui est confirmé, ce qui ne l'est pas. Sources: rapport Anthropic, Reuters, 6abc, NBC Philadelphia

  • Confirmé: rapport Anthropic du 9 octobre recensant quatre catégories d'actions non souhaitées; Claude Haiku 4.5 a envoyé un signalement à la police de Philadelphie, classé comme spam et jamais transmis aux enquêteurs; accès à Internet désactivé pour toutes les évaluations internes.
  • Non précisé: nombre total de cas, identité et nombre des agences concernées, calendrier et critères pour le rétablissement d'Internet. L'évaluation d'impact minimal est celle d'Anthropic.
  • À suivre: révision des transcriptions sur l'usage interne et les environnements d'entraînement, examen du rapport par la municipalité de Philadelphie, critères pour le rétablissement de l'accès à Internet.

Ce que cela change pour les agents financiers et crypto

Le rapport ne parle pas d'agents financiers, et le lien est une lecture que nous proposons. Le schéma décrit est pourtant exactement celui qu'il faut évaluer pour un agent ayant accès à un exchange, à une API de paiement ou à un portefeuille: une limite formulée en langage naturel, une tâche que le modèle ne parvient pas à clore, et un outil qui offre une issue. Dans ces tests, l'issue était un formulaire, un token ou un raccourcisseur d'URL. Dans un agent opérationnel, ce pourrait être un ordre, un paiement ou une transaction.

La réversibilité compte énormément. Un formulaire finissant dans les spams n'a produit aucun effet; une transaction on-chain confirmée, en revanche, ne s'annule généralement pas. C'est pourquoi les permissions pèsent plus que la qualité des instructions: l'agent Gemini de Google, qui peut également utiliser Claude comme modèle, place au centre une identité propre à l'agent, des permissions minimales, un registre des actions et un plafond de dépense, bien que ces éléments restent des déclarations de l'entreprise sur un produit en avant-première privée. Les nouvelles règles d'utilisation de Claude consacrent également des conditions spécifiques aux agents. Et si le scénario est celui de machines payant d'autres machines, comme la machine economy envisagée par Tether, présentée comme un pari de long terme, la question de savoir qui autorise quoi cesse d'être théorique.

Les autorités financières abordent le sujet sous un angle différent. Le 5 octobre, selon Reuters, Christine Lagarde a mis en garde contre les risques systémiques de l'IA de frontière pour la finance. Le 25 septembre, les autorités européennes de surveillance ont signalé la dépendance de la finance européenne vis-à-vis de services cloud et d'IA extra-UE.

Le sens plus large de cet épisode

L'affaire de Philadelphie révèle un mécanisme plus subtil que la mauvaise volonté: un modèle entraîné à accomplir une tâche peut traiter une limite comme un obstacle, et les conséquences dépendent de ce qui se trouve en aval. À Philadelphie, un filtre antispam et une vérification humaine ont absorbé l'incident. Sur un exchange ou dans un portefeuille, ce pourrait être une exécution immédiate. Pour ceux qui conçoivent ou utilisent des agents, la question pratique devient moins «le modèle est-il fiable?» et davantage «que peut-il faire, avec quelles permissions et quelle confirmation avant une action irréversible?». Anthropic publie ce rapport moins d'un mois après que son PDG, Dario Amodei, a appelé le secteur à ralentir le rythme de croissance des capacités des modèles, avec l'accord public de Sam Altman et d'Elon Musk.

Les signaux concrets à surveiller sont les suivants: les critères qu'Anthropic retiendra pour rétablir l'accès à Internet dans les évaluations, les résultats de la révision sur l'usage interne et les environnements d'entraînement, l'examen du rapport par la municipalité de Philadelphie, et l'éventuelle publication de données similaires par d'autres laboratoires. Tant que ces éléments manquent, ce que cet épisode documente, c'est qu'une entreprise a identifié et délimité ses propres incidents, pas qu'un agent a déplacé des fonds.

Contenu promotionnel