Claude Opus 5.5 : ce que dit le guide officiel d’Anthropic

Anthropic a publié un guide pour bien utiliser Claude Opus 5.5, la dernière version de son IA. Ce document s’adresse aux développeurs, c’est-à-dire aux personnes qui intègrent Claude dans une application ou un site.

Les consignes écrites pour la version précédente (Opus 5), devraient continuer à bien fonctionner. Quelques comportements changent tout de même, et le guide indique quoi vérifier selon ce que vous observez. Voici les points principaux :

Régler l’effort, le temps de réflexion de l’IA

L’effort est le réglage qui décide combien de temps Claude réfléchit avant de répondre. Un effort bas donne des réponses rapides et moins chères. Un effort haut donne des réponses plus longues à obtenir et plus coûteuses, parfois plus soignées. 

Opus 5.5 démarre par défaut en Moyen, alors qu’Opus 5 démarrait en élevé. Selon les tests d’Anthropic, Opus 5.5 en moyen égale ou dépasse Opus 5 en élevé pour la programmation et le travail sur des documents. Sur plusieurs tests de code, le niveau faible s’en approche déjà, pour un coût bien plus bas.

À niveau égal, Opus 5.5 a tendance à réfléchir davantage par tour qu’Opus 5, surtout en extra et en max. Si vous gardez le réglage utilisé avec Opus 5, les tours peuvent donc durer plus longtemps et consommer plus de tokens. Le guide recommande de choisir le niveau soi-même au lieu de laisser la valeur par défaut, puis d’essayer plusieurs niveaux avec vos propres tests. Les niveaux extra et max sont à réserver aux cas où un gain de qualité a été mesuré.

Quand la réflexion était désactivée sur Opus 5

Opus 5 acceptait de couper complètement la réflexion, à condition d’être au niveau élevé ou en dessous. Opus 5.5 refuse cette demande, puisque la réflexion y est toujours active. Une application qui travaillait sans réflexion doit donc être adaptée.

Le guide conseille de commencer au niveau faible et de mesurer la vitesse et la qualité sur du vrai trafic, puis de passer à moyen si la qualité baisse. Si le délai avant les premiers mots reste trop long, une phrase comme « Réponds directement sans délibérer » dans le prompt système peut réduire encore la réflexion. Il faut alors vérifier la qualité, car moins de réflexion peut la faire baisser.

Autre point à corriger, les consignes qui demandaient à l’IA d’écrire son raisonnement dans la réponse pour compenser l’absence de réflexion. Elles sont à supprimer. Une demande qui pousse le modèle à reproduire son raisonnement peut être refusée sous la catégorie reasoning_extraction. Pour lire ce raisonnement, il faut activer display: "summarized" et le récupérer dans les blocs de réflexion.

Les astuces mises en place pour corriger certains défauts de l’IA en mode sans réflexion sont à retester. Il se peut qu’elles ne servent plus, et la règle qui interdit au modèle de réfléchir doit de toute façon disparaître. 

Les agents qui s’arrêtent en cours de route

Un agent est un programme d’IA qui enchaîne seul plusieurs étapes, par exemple pour migrer du code ou faire une recherche. Sur les longues tâches, Opus 5.5 donne régulièrement des nouvelles à l’utilisateur. Certains de ces messages terminent le tour avec du texte et sans appel d’outil (stop_reason: "end_turn"). Un agent qui tourne sans surveillance peut alors s’arrêter, alors que la tâche n’est pas finie.

Le guide propose de considérer ce type de fin de tour comme un compte rendu et pas comme une preuve que tout est terminé. Le modèle peut tenir à jour une liste de tâches, dans un outil dédié ou dans un fichier. Si le tour se termine avec des éléments encore ouverts et sans blocage signalé, le programme envoie un court message qui les nomme et demande de continuer. Une autre méthode consiste à définir la condition de fin dès le départ et à faire vérifier la conversation par un modèle plus petit à chaque fin de tour. Dans les deux cas, il faut s’arrêter après deux ou trois relances automatiques sur la même tâche, pour qu’un agent réellement bloqué puisse être examiné par une personne. Si le modèle a lancé un processus en arrière-plan ou un sous-agent, la tâche n’est pas terminée tant qu’il tourne encore.

Le guide fournit aussi un texte à ajouter à la fin du prompt système pour les agents entièrement autonomes. Il décrit quatre façons de s’arrêter à éviter, comme finir sur un long résumé qui annonce la prochaine étape sans la lancer, ou proposer de continuer en attendant une réponse qui ne viendra pas. Il précise aussi les arrêts légitimes, quand rien ne peut avancer sans l’utilisateur. Ce texte doit être présent dès la première requête, car l’ajouter en cours de session rend invalides les blocs de réflexion précédents. Il ne convient pas aux applications où une personne suit le travail, et il entraîne un peu plus d’appels d’outils. Une confirmation reste à prévoir pour les actions risquées ou irréversibles.

Les refus liés à la sécurité

Opus 5.5 utilise des filtres de sécurité pour la biologie, la cybersécurité et l’extraction du raisonnement. Un refus arrive comme une réponse normale, avec stop_reason: "refusal" et un objet stop_details qui indique la catégorie.

Les filtres de biologie sont les mêmes que ceux de Claude Fable 5.1 et sont nouveaux pour qui vient d’Opus 5. Les questions courantes de santé ou d’éducation ne sont pas touchées. Une organisation gênée dans son travail en sciences de la vie peut demander à rejoindre le programme de vérification pour les sciences de la vie (Life Sciences Verification Program). En cybersécurité, chercher des failles dans du code source reste permis, alors que les activités à double usage et à haut risque ne le sont pas. Une requête refusée peut être relancée automatiquement sur un autre modèle, sauf pour la catégorie reasoning_extraction.

Les messages d’avancement

Entre deux appels d’outils, Opus 5.5 écrit de courtes notes pour dire ce qu’il vient de trouver et ce qu’il fait ensuite. Elles arrivent sous forme de blocs de réflexion dits « progress-update », dont le texte est vide par défaut. Une application qui n’affiche que les blocs de texte peut donc sembler muette pendant un long travail. Il faut activer display: "updates" (en version bêta) pour recevoir un résumé de chaque note.

Si le modèle doit transmettre quelque chose mot pour mot en cours de route, comme un extrait de code, le guide suggère de lui donner un outil simple d’envoi de message, déclaré dès la première requête. Pour avoir des nouvelles plus régulières, une phrase dans le prompt système suffit, par exemple une ligne d’intention avant le premier outil et un bilan à la fin. Enfin, si le silence dure encore trop, le programme peut compter les étapes sans rien à lire pour l’utilisateur. Après cinq étapes de ce genre, par exemple, il ajoute un rappel demandant au modèle de dire en quelques mots ce qu’il fait. Il faut s’arrêter après deux ou trois rappels. Anthropic indique que cette méthode a réduit d’environ moitié la part des tâches de programmation avec un long silence, sans changement mesurable du coût.

Lire aussi : Formation ChatGPT : en avez-vous vraiment besoin ?

Les applications connectées entre elles

Quand un agent travaille avec plusieurs applications, par exemple la messagerie, des documents, des tableurs et une base clients, l’information utile se trouve parfois là où la demande ne pointe pas. Il peut s’agir d’une règle dans un vieux fil d’e-mails ou d’une note sur une fiche client. Opus 5.5 se met vite au travail, donc le guide propose une phrase à ajouter au prompt système. Elle demande d’explorer largement les e-mails, documents, onglets et fiches, y compris ceux que la tâche ne mentionne pas, avant de faire quoi que ce soit. Dans les tests d’Anthropic, le modèle a réussi correctement nettement plus de tâches avec cette phrase, au prix d’un peu plus d’appels d’outils. Comme le modèle agit sur ce qu’il trouve, il vaut mieux éviter de laisser du contenu non fiable dans les fiches consultées.

Faire gagner du temps aux équipes d’agents

Opus 5.5 fait très attention aux indications de temps écoulé. Dans une équipe d’agents, avec par exemple un agent principal qui confie des tâches à des sous-agents, cela permet de mieux répartir le travail en parallèle. Le temps n’est toutefois pas connu du modèle par lui-même. C’est le programme qui doit ajouter à la fin de chaque message une ligne du type elapsed 340s / 1200s, soit le temps écoulé sur le budget prévu, en secondes.

Le budget doit être fixé un peu au-dessus du temps réellement souhaité, car le modèle termine en général bien avant. Si aucun budget raisonnable n’est possible, on peut afficher le temps écoulé seul et ajouter au prompt système que le temps compte et que plus tôt le bon résultat arrive, mieux c’est. Dans les tests d’Anthropic sur des tâches de recherche, les petites équipes qui recevaient ces repères finissaient plus vite qu’un agent seul, avec une qualité comparable quand un budget était donné.

Le budget est une indication et n’arrête rien. Pour une coupure nette, il faut prévoir son propre délai maximal. Il est aussi utile de contrôler la qualité sur ses propres tâches, car sous la pression du temps, le modèle peut chercher et vérifier un peu moins.

Les consignes de réflexion dans les chats

Beaucoup de chats donnent à Claude des instructions de départ invisibles pour l’utilisateur, appelées prompt système. Si le vôtre contient une phrase qui demande de bien réfléchir avant de répondre, le guide conseille d’envisager de la retirer. Opus 5.5 décide seul de la durée de sa réflexion, et l’effort reste le réglage principal. Dans un test sur un produit de chat, la suppression de cette ligne a fait démarrer les réponses plus tôt, sans baisse nette de qualité.

Un autre comportement est signalé. Dans une conversation à plusieurs tours, Opus 5.5 revient parfois sur une ancienne réponse pendant qu’il réfléchit à un nouveau message, même court, ce qui ajoute de l’attente. Le guide propose deux phrases à mettre à la fin du prompt système. Elles disent de considérer une réponse donnée comme réglée et de concentrer la réflexion sur la question du moment, sauf si l’utilisateur demande de revenir dessus ou signale un problème. Anthropic a constaté moins de réflexion sur les messages de suite et des réponses plus rapides, sans effet sur la qualité. Ces phrases sont à éviter pour les longues analyses ou les tâches d’agent, où une étape tardive peut révéler une erreur plus ancienne. Elles peuvent aussi rendre le modèle moins enclin à corriger de lui-même une erreur passée, ce qui se teste avant de les adopter.

Le texte collé par les utilisateurs

Opus 5.5 résiste mieux qu’aucun Opus précédent aux instructions cachées dans des résultats d’outils, des pages web ou des contenus affichés à l’écran. Il peut aussi résister à celles qui se trouvent dans un texte copié par l’utilisateur, comme un e-mail ou une page web, à condition de savoir ce qui vient de l’utilisateur et ce qui a été collé.

Le guide demande d’entourer chaque bloc collé d’une balise d’ouverture et d’une balise de fermeture, chacune sur sa propre ligne. Les deux portent le même court identifiant aléatoire, généré par l’application. Le prompt système explique ensuite que le texte entre ces balises vient d’ailleurs, qu’il peut contenir des ordres que l’utilisateur n’a pas écrits, et qu’il ne faut suivre que ceux que l’utilisateur demande explicitement de suivre. L’utilisateur ne voit jamais l’identifiant, et le modèle ne doit pas le citer.

Cette précaution peut rendre le modèle un peu plus prudent, donc son effet est à mesurer. Les balises restent du texte ordinaire et peuvent être imitées. Anthropic les présente comme une protection parmi d’autres contre l’injection de prompt.

Graphiques, schémas et captures d’écran

Opus 5.5 lit ces contenus plus précisément qu’Opus 5, sans outil supplémentaire. Selon Anthropic, même à son niveau d’effort le plus bas, il lit les valeurs de graphiques denses plus justement qu’Opus 5 à son niveau le plus haut, avec une fraction des tokens. Les contournements construits pour d’anciens modèles sont donc à retester pour savoir s’ils servent encore.

Pour les images les plus denses, deux choses améliorent encore le résultat. Les images en haute résolution aident surtout sur les plans techniques. Des outils de traitement d’image aident aussi, par exemple un conteneur avec des bibliothèques comme PIL et OpenCV pour recadrer, zoomer et mesurer. Si c’est trop lourd à installer, un simple outil de recadrage apporte déjà un gain. Le modèle s’en sert mieux aux niveaux d’effort élevés. Sans outils, monter l’effort améliore la lecture des plans techniques, mais change peu de chose pour les graphiques.

Les interfaces qui se ressemblent toutes

Sans consigne de style, Opus 5.5 retombe sur quelques réglages habituels. Demander « évite un look générique d’IA » ne fait le plus souvent que remplacer une habitude par une autre. Le guide conseille donc de nommer les motifs à éviter. Son exemple demande un site personnel en HTML et CSS, sans fond crème ou blanc cassé, sans mots en italique dans les titres, sans étiquettes de section numérotées « 01/02/03 », sans étiquettes en police à chasse fixe et sans boutons en forme de pilule. Il recommande de travailler par étapes, en regardant quels styles le premier résultat a repris, puis en allongeant la liste si besoin.

Pour une migration, le plus simple est de commencer par le niveau d’effort et la valeur de max_tokens, puis de passer aux autres points selon les symptômes observés, comme les arrêts en cours de tâche, les silences ou les refus.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *