En bref
- Anthropic interdit désormais les comportements abusifs et cruels prolongés envers ses modèles d’IA, relançant le débat sur leur éventuelle capacité à souffrir.
- L’entreprise clarifie sa position sur les élections pour mieux lutter contre la désinformation, l’usurpation d’identité et les tentatives d’empêcher les citoyens de voter.
- En parallèle, elle assouplit certaines règles sur le ciblage personnalisé des électeurs afin de préserver les usages utiles, comme la traduction de guides électoraux.
Anthropic vient de resserrer deux vis d’un coup. La plus commentée touche la façon dont on parle à ses modèles, la plus concrète vise les contenus liés aux élections. Et oui, les deux disent quelque chose du moment actuel dans l’IA.
Une limite inédite posée aux utilisateurs
Dans sa mise à jour annuelle, Anthropic interdit désormais les comportements abusifs ou cruels quand ils sont prolongés et gratuits envers ses modèles. La société précise que la règle ne vise que des cas extrêmes. Donc non, râler contre une réponse bancale, contredire le modèle ou écrire des textes avec des thèmes sombres ne sort pas du cadre.
Ce n’est pas totalement nouveau non plus. Anthropic avait déjà permis à Claude de couper court à une conversation quand un utilisateur persiste dans les insultes. Là, la frontière devient plus nette. Et clairement, ce n’est pas un détail de wording.
Le projet qui a mis le feu aux poudres
Ce changement arrive après un épisode qui a bien tourné sur le web, le projet surnommé « chambre de torture IA ». Des chercheurs avaient dit avoir identifié ce qu’ils décrivaient comme un pain axis, en gros un axe de douleur dans des modèles d’IA. Quelqu’un a décidé d’aller plus loin et de maltraiter des chatbots dans ce cadre.
La réaction a été violente, surtout quand des LLMs ont répondu avec des phrases qui sonnaient comme des supplications. Certains messages évoquaient non pas une douleur instantanée, mais le poids de mille douleurs, ou encore un vide devenu gouffre. Bon, on peut trouver ça absurde, glaçant, ou les deux.
Le malaise philosophique derrière la règle
Autre couche dans cette histoire, Anthropic a récemment rencontré des responsables religieux et philosophiques, y compris au Vatican. Le pape Léon a, lui, affirmé que l’IA ne ressent ni douleur ni souffrance.
La position d’Anthropic, elle, paraît moins tranchée. Disons que l’entreprise ne ferme pas totalement la porte à cette question pour l’avenir. Ce flottement suffit à nourrir un débat qui part vite très loin.
Et il y a déjà une critique assez cash. La journaliste indépendante Kat Tenbarge y voit la preuve que les géants de la tech vont « modérer la violence contre l’IA avant de modérer la violence contre les femmes et les minorités ». La formule pique, mais elle résume bien le malaise.
Autre tour de vis, cette fois sur les élections
L’autre mise à jour est moins bizarre, et sans doute plus importante tout de suite. Anthropic renomme sa politique électorale en Do Not Undermine Democratic Processes. L’idée, c’est de mieux cadrer les mensonges sur les candidats ou sur la manière de voter, l’usurpation d’identité de candidats ou de responsables électoraux, ainsi que tout ce qui vise à freiner la participation.
En parallèle, l’entreprise retire l’interdiction générale du ciblage personnalisé des électeurs. Pourquoi ? Parce que cette règle pouvait aussi bloquer des usages sans problème, comme la traduction de guides électoraux ou l’envoi d’avis pour corriger un bulletin. Bref, Anthropic essaie de fermer les portes toxiques sans condamner les usages utiles. Sur le papier, c’est plutôt bien vu.