Réponse rapide
Le prompt engineering est la discipline systématique qui consiste à concevoir et à optimiser les entrées afin de guider les modèles d'IA générative vers des sorties exactes, fiables et prêtes pour la production, en influençant les distributions de probabilité de tokens qui les sous-tendent.
- Maîtrisez les 6 techniques clés : zero-shot, few-shot, chaîne de pensée, jeu de rôle, format de sortie, chaînage de prompts.
- La réussite exige un état d'esprit scientifique : passer de l'intuition anecdotique à la mesure itérative.
- En 2026, le domaine évolue vers le context engineering — la discipline qui sous-tend les agents à état construits avec LangGraph et CrewAI.
Vous demandez à un modèle de langage de résumer un contrat. La sortie fait trois paragraphes — verbeux, prudents, passant à côté des clauses essentielles. Vous réessayez avec d'autres mots. Mieux, mais toujours pas ce qu'il vous fallait. Au cinquième essai, quelque chose se met en place. Cet écart — entre « poser une question à une IA » et « obtenir de façon fiable la sortie dont vous avez besoin » — c'est là que vit le prompt engineering.
Cette première leçon définit la discipline depuis ses fondations : ce qu'est réellement un prompt au niveau du modèle, ce que signifie l'ingénierer, et où en est le domaine en 2026. Sautez-la, et chaque technique apprise ensuite ressemblera à une astuce plutôt qu'à un principe.
1. Qu'est-ce qu'un prompt, au juste ?
Un prompt est toute entrée présentée à un modèle d'IA générative pour en obtenir une sortie. Dans les modèles textuels, cette entrée est une séquence de tokens — des unités sous-lexicales que le modèle a appris à associer à des représentations internes. Le travail du modèle est de prédire la continuation la plus probable de cette séquence, à la lumière de tout ce qu'il a appris pendant son entraînement.
C'est le point le plus important à saisir : un modèle de langage n'est ni un moteur de recherche, ni une base de données, ni un système de raisonnement au sens humain. C'est, fondamentalement, une distribution de probabilité conditionnelle. À partir des tokens que vous fournissez, il estime la probabilité de chaque token suivant possible, échantillonne dans cette distribution selon un paramètre de température, et recommence jusqu'à ce qu'une condition d'arrêt soit remplie.
Le modèle fondamental
P(output | prompt)
Le modèle attribue une probabilité à chaque continuation possible de votre entrée. Le prompt engineering est la discipline qui façonne cette distribution pour que la région de plus forte probabilité coïncide avec la sortie que vous voulez vraiment.
Schulhoff et al. (2024) définissent un prompt comme « n'importe quel type d'entrée adressée à un modèle d'IA générative » et recensent les composants récurrents qu'il peut contenir : une directive, des exemples, des instructions de format de sortie, des instructions de style, un rôle ou une persona, et des informations contextuelles supplémentaires. Leur revue — la synthèse systématique la plus complète jamais publiée sur les techniques de prompting, couvrant 1 565 articles et recensant 58 techniques distinctes — fournit la taxonomie la plus rigoureuse disponible.
1,565
Articles analysés
58
Techniques recensées
6
Qui comptent en production
Le prompt engineering est donc le processus itératif de conception, d'affinage et d'évaluation des prompts, afin de produire de façon constante des sorties qui atteignent un niveau de qualité défini. Le mot « ingénierie » est délibéré : il suppose de la mesure, de l'itération et l'application de méthodes raisonnées — pas des conjectures ni une formulation heureuse.
2. Pourquoi le prompt engineering compte
L'argument pratique est simple. Un même modèle — poids identiques, API identique — peut produire des sorties allant de l'inutile à l'extraordinaire selon la façon dont on le sollicite. Brown et al. (2020), en présentant GPT-3 et la notion d'apprentissage en contexte, ont montré qu'un modèle aux poids figés pouvait égaler — et, sur certains bancs d'essai, dépasser — des systèmes affinés pour une tâche précise, uniquement par ce qui était placé dans son prompt. Ce résultat a été reproduit et étendu dans des centaines d'études ultérieures.
L'argument économique est tout aussi net. Affiner un modèle de pointe — ajuster ses poids sur des données propres à une tâche — coûte cher, prend du temps et risque l'« oubli catastrophique » — une perte de performance sur les tâches générales — en particulier lors d'un affinage complet sur de petits jeux de données. Le prompt engineering obtient des gains comparables sur la plupart des tâches en heures plutôt qu'en semaines, pour un coût marginal quasi nul par itération. La documentation d'Anthropic note elle-même que bien des équipes se tournent vers l'affinage avant d'avoir exploré à fond ce que le prompt engineering peut accomplir — une erreur d'ordonnancement qui coûte du temps et de l'argent.
Le prompt engineering est aussi devenu une discipline d'ingénierie de production. Fonctionnalités d'IA en temps réel, agents face aux clients, pipelines de classification automatisés — tous dépendent de prompts au comportement prévisible sur toute une distribution d'entrées, et pas seulement sur un exemple trié sur le volet. Sur le marché du travail, il apparaît désormais moins comme un intitulé de poste autonome que comme une exigence centrale des rôles d'ingénierie IA, de data science et de produit.
3. L'anatomie d'un prompt
La plupart des prompts qui sous-performent ne sont pas faux — ils sont incomplets. Six composants, chacun avec une fonction distincte ; tous ne sont pas nécessaires dans chaque prompt.
Directive
L'instruction principale — ce que vous voulez que le modèle fasse. Ex. : « Résume le contrat suivant en trois puces. »
Rôle et persona
Qui est le modèle pour cette tâche — active le vocabulaire et le style du domaine. Ex. : « Tu es un juriste senior spécialisé dans les contrats SaaS. »
Contexte
Les éléments dont le modèle a besoin mais que son entraînement ne lui donne pas. Ex. : le texte du contrat, le secteur du client, la juridiction applicable.
Exemples
Des démonstrations de la correspondance entrée → sortie visée. Ex. : un contrat type associé à un résumé en puces type.
Contraintes
Limites de périmètre, exclusions et seuils de qualité. Ex. : « Concentre-toi uniquement sur les clauses de paiement et de résiliation. Ne résume pas les clauses de style. »
Format de sortie
La structure et le type exacts de la réponse — ce qui rend les prompts composables. Ex. : « Renvoie un objet JSON avec les clés : summary (chaîne), risk_flags (tableau de chaînes), max_length (150 mots). »
Le tableau ci-dessus condense la taxonomie de Schulhoff et al. pour un usage de production — les instructions de style sont absorbées dans le format de sortie — et promeut les contraintes au rang de composant explicite, une exigence que les taxonomies académiques érigent rarement en élément de premier plan.
Pour une tâche simple et ponctuelle, directive + contexte peuvent suffire. Pour un pipeline de production où la sortie est analysée par un autre système, les six composants sont généralement nécessaires. Le mode de défaillance le plus courant des prompts de production est l'omission du format de sortie — on laisse alors le modèle choisir une structure, ce qu'il fera différemment à chaque exécution.
Règle pratique
Un prompt est complet lorsqu'un collègue attentif — qui ne voit que le prompt, pas le cas d'usage visé — peut prédire à la fois ce que vous voulez et à quoi ressemble une « bonne » réponse. S'il n'y arrive pas, c'est qu'il manque quelque chose.
4. Les six techniques clés
Cinquante-huit techniques apparaissent dans la littérature ; six couvrent la majorité des cas d'usage en production. Apprenez celles-là d'abord — considérez tout le reste comme une extension.
Classify the sentiment of the following customer review as Positive, Neutral, or Negative. Reply with only the label. Review: "The delivery was three days late and the packaging was damaged, but the product itself works exactly as described."
Fonctionne de façon fiable quand la tâche est bien définie, que l'espace des sorties est réduit et sans ambiguïté, et que le modèle a vu des tâches similaires à l'entraînement.
Classify the sentiment. Reply with only the label. Review: "Arrived early, works perfectly." -> Positive Review: "It works, but the manual is useless." -> Neutral Review: "The delivery was three days late."
Brown et al. (2020) ont introduit le prompting few-shot comme mécanisme principal d'adaptation en contexte : en incluant des exemples de démonstration dans le prompt, le modèle saisit le motif sans aucune mise à jour de ses poids. Dans leurs évaluations, GPT-3 en few-shot approchait — et sur certains bancs d'essai égalait — des modèles affinés pour la tâche. En pratique, deux à huit exemples bien choisis suffisent généralement à verrouiller le format, l'ensemble d'étiquettes et le comportement sur les cas limites qui vous importent.
La qualité des exemples compte davantage que leur quantité. Chaque exemple devrait représenter la frontière de décision qui vous intéresse — les cas que le modèle trouvera les plus difficiles en production.
Classify the sentiment of the review. Think step by step: list what the reviewer praises, list what they criticise, weigh the two, then give the label on its own final line prefixed with "Label:".
Wei et al. (2022) ont montré qu'inviter les modèles à produire des étapes de raisonnement intermédiaires avant la réponse finale améliore spectaculairement le raisonnement en plusieurs étapes : avec PaLM 540B, le prompting en chaîne de pensée a fait passer la justesse sur le banc d'essai mathématique GSM8K de 18 % à 57 % — un gain d'environ un facteur trois, sans aucune modification du modèle. Externaliser les étapes vous donne en outre une trace visible pour déboguer quand la réponse finale est fausse.
You are a customer experience analyst for a logistics company. You care about separating delivery issues from product issues. Classify the sentiment of the review below, and say which of the two categories drove your answer.
Attribuer un rôle déplace la distribution a priori du modèle en activant le vocabulaire, le style épistémique et les critères de décision associés à ce domaine. Anthropic recommande la spécification du rôle comme technique de premier plan dans la couche du system prompt. Une réserve honnête : l'effet mesurable est le plus net sur le ton, le vocabulaire et le cadrage. Des études contrôlées montrent que les personas n'améliorent pas de façon fiable l'exactitude factuelle sur des tâches objectives — traitez donc le rôle comme un outil de cadrage et de style, et vérifiez tout gain d'exactitude sur votre propre jeu de test plutôt que de le présumer.
Classify the sentiment of the review.
Reply with JSON only, no prose:
{"label": "Positive|Neutral|Negative", "confidence": 0.0-1.0,
"drivers": ["..."]}
La spécification du format est ce qui rend les prompts composables. Une spécification explicite doit définir : le conteneur externe (JSON, Markdown), le nom des champs et les contraintes de type.
Step 1 — Extract every distinct claim in the review. Step 2 — For each claim, label it delivery, packaging or product. Step 3 — Given the labelled claims, return one overall sentiment. Each step is a separate call. The output of one is the input of the next.
Les tâches complexes dépassent ce qu'un prompt unique peut accomplir de façon fiable. Le chaînage de prompts décompose la tâche en étapes successives, où la sortie de chaque étape devient l'entrée de la suivante.
Le chaînage est aussi le socle des architectures d'agents modernes. Ce que LangChain, CrewAI et les frameworks similaires mettent en œuvre à grande échelle, c'est du chaînage de prompts assorti d'un accès aux outils et de branchements conditionnels. Comprendre le chaînage comme motif de conception — avant de se tourner vers un framework — est indispensable pour construire des agents que l'on peut déboguer quand ils échouent.
5. L'évolution de 2025 : le context engineering
En septembre 2025, Anthropic a publié un article technique soutenant que le domaine entrait dans une nouvelle phase : le context engineering. La distinction est importante et mérite d'être comprise avec précision.
Prompt engineering et context engineering
- Objet. Écrire des instructions efficaces, contre organiser tout ce qui entre dans la fenêtre de contexte.
- Périmètre. Le texte du prompt, contre system prompt + outils + mémoire + données récupérées + historique des messages.
- Cas d'usage. Tâches à un tour, classification, génération, contre agents multi-tours et tâches à long horizon.
- Difficulté. Quoi dire et comment le dire, contre quelle information entre dans la fenêtre, quand et en quelle quantité.
- Risque principal. Ambiguïté, contraintes manquantes, contre la « pourriture de contexte » — la dégradation des performances sur les contextes longs.
Anthropic définit le context engineering comme « l'ensemble des stratégies permettant d'organiser et de maintenir le jeu optimal de tokens (d'informations) pendant l'inférence d'un LLM, y compris toutes les autres informations qui peuvent y atterrir en dehors des prompts ». La motivation est mesurable : le rapport technique de Chroma sur le phénomène montre les performances des LLM se dégrader — et devenir moins régulières — à mesure que la longueur de l'entrée augmente, même lorsque la tâche reste identique. Le terme consacré pour cette dégradation est context rot, la pourriture de contexte.
Ce qu'il faut en retenir en pratique en 2026 : le prompt engineering est le socle. Le context engineering est la couche suivante, pertinente dès que vous construisez des agents ou des systèmes multi-tours. On ne peut pas faire de context engineering sans d'abord savoir faire du prompt engineering. Cette série suit cet ordre — les fondamentaux ici, puis les system prompts, les techniques de raisonnement, le chaînage de prompts et la génération augmentée par récupération (RAG), où le context engineering devient le travail quotidien.
Le résumé en une ligne
Le prompt engineering décide de ce que vous dites ; le context engineering décide de ce que le modèle voit. Les recommandations d'Anthropic traitent la fenêtre de contexte comme un budget d'attention fini : chaque token ajouté entre en concurrence avec tous les autres, si bien que le travail consiste à réunir le plus petit ensemble de tokens à fort signal qui permette au modèle de faire le travail.
6. Le bon état d'esprit
L'erreur la plus répandue en prompt engineering est de le traiter comme un exercice créatif — ciseler la phrase parfaite à l'intuition et au panache. Les praticiens qui produisent des prompts fiables de façon constante le traitent comme un processus scientifique : hypothèse, mesure, itération.
Trois habitudes séparent les praticiens méthodiques de ceux qui s'en remettent à la chance :
- Écrivez un jeu de test avant d'écrire le prompt. Définissez 8 à 15 entrées représentatives avec leurs sorties attendues. Sans vérité terrain, chaque itération est évaluée sur un échantillon de un — ce qui n'est pas une évaluation, mais une anecdote.
- Ne changez qu'une variable à la fois. Si vous modifiez le rôle et le format dans la même itération et que la performance s'améliore, vous n'avez rien appris sur la cause. Traitez chaque composant du prompt comme une variable indépendante.
- Mesurez sur l'ensemble du jeu de test. Un changement qui améliore trois cas mais en dégrade quatre n'est pas une amélioration. Notez globalement. Les prompts de production échouent dans la queue de la distribution, pas au centre.
Cette approche est partiellement automatisable. Zhou et al. (2022) ont montré qu'un modèle de langage peut servir à générer et à évaluer des prompts candidats, en retenant ceux qui maximisent la performance sur un jeu réservé — leur système Automatic Prompt Engineer (APE) a dépassé des prompts écrits par des humains sur plusieurs bancs d'essai. L'approche automatisée confirme le même principe : l'évaluation sur un ensemble, et non sur un exemple isolé, est le seul signal qui compte.
« Voyez Claude comme un stagiaire à son premier jour : donnez des instructions claires et explicites, avec tout le détail nécessaire. Gardez à l'esprit que le prompt engineering est une science, et abordez-le en scientifique : testez vos prompts et itérez souvent. »
Une dernière observation : le paysage du prompting bouge à chaque génération de modèles. Une technique qui améliore nettement la sortie d'un modèle peut être redondante ou contre-productive sur le suivant. Les modèles de raisonnement traitent la logique pas à pas en interne ; les fenêtres de contexte plus longues déplacent le goulot de la compression vers la gestion de l'attention ; les API d'usage d'outils changent la façon dont les spécifications de format se traduisent en sorties structurées. Ce qui reste stable, c'est le modèle mental — comprendre que vous façonnez une distribution de probabilité, et non que vous adressez des commandes à une base de données.
Cette leçon vous a-t-elle été utile ?
FAQ
Questions fréquentes
Plus que jamais — il a simplement changé de forme. À mesure que les modèles progressaient, les astuces fragiles sont tombées et les principes durables sont devenus le socle du context engineering : décider ce qu'un agent à état voit à chaque étape. C'est cette discipline que ce cursus enseigne.
Pas pour les premières leçons. À partir des leçons sur les agents, les exemples sont en Python, et vous en tirerez davantage si vous pouvez les exécuter et les modifier.
La documentation d'un éditeur décrit ce que fait une API. Ceci décrit ce qui survit au contact de la production, y compris les modes de défaillance que cette documentation n'a aucune raison de mentionner.
La leçon 02. Le Playbook est écrit pour être lu dans l'ordre et chaque leçon suppose la précédente.
Références
- Schulhoff, S., et al. (2024). The Prompt Report: A Systematic Survey of Prompting Techniques. arXiv:2406.06608.
- Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS 2020.
- Anthropic. (2025). Prompting Best Practices — Claude API Documentation. docs.anthropic.com.
- Sayer, P. (2025). Context Engineering: Improving AI by Moving Beyond the Prompt. CIO Magazine.
- Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
- Anthropic Engineering. (2025). Effective Context Engineering for AI Agents. anthropic.com/engineering.
- Zhou, Y., et al. (2022). Large Language Models Are Human-Level Prompt Engineers. ICLR 2023. arXiv:2211.01910.
- OpenAI. (2024). Prompt Engineering Guide. platform.openai.com/docs/guides/prompt-engineering.
- Elastic Search Labs. (2026). Context Engineering vs. Prompt Engineering. elastic.co/search-labs.
Envie de vous tester ?
10 questions tirées au hasard des six leçons de la Partie I. Sans limite de temps. Partagez votre score.