---
title: "Évaluer et améliorer une appli IA, expliqué avec un examen · Mode d'emploi · Consonance"
description: "Deux commandes du skill claude-api : build-eval construit une évaluation dans votre code, avec votre accord, et hillclimb améliore votre appli contre elle, un changement à la fois, en gardant des exemples de côté contre l'overfitting."
canonical: "https://consonance.fyi/mode-d-emploi/automating-eval-design-and-hillclimbing"
lang: "fr"
published: "2026-10-03"
---

# Évaluer et améliorer une appli IA, expliqué avec un examen

_Série Claude · fiche n° 3_

## En une phrase

Deux commandes du skill claude-api : build-eval construit une évaluation dans votre code, avec votre accord, et hillclimb améliore votre appli contre elle, un changement à la fois, en gardant des exemples de côté contre l'overfitting.

## L'image : un examen

| Dans la vie | Dans Claude Code |
| --- | --- |
| un examen | une éval : un signal sur la façon dont votre appli fait une tâche |
| réviser, une chose à la fois | le hillclimb : un changement par tour · `/claude-api hillclimb` |
| un examen qui ressemble à la vraie vie | des tâches qui ressemblent à la production |
| le meilleur élève a la meilleure note | un modèle plus fort, plus de réflexion : un meilleur score |
| personne n'a 100 % | le meilleur modèle reste bien sous 100 % |
| la même copie, la même note | peu de variance d'un essai à l'autre |
| un prof qui n'écrit que les pièges d'un seul élève | des cas choisis seulement parce que le modèle d'aujourd'hui les rate |
| un correcteur qui corrige deux fois la même copie | le correcteur est lancé deux fois sur la même sortie |
| apprendre les annales par cœur | l'overfitting : mieux sur l'éval que sur la production |
| un examen blanc jamais vu | un jeu test que le hillclimber ne lit jamais |

## Pour essayer

1. Mettez Claude Code à jour : le skill claude-api est livré avec.

   ```
   claude update
   ```
2. Construisez l'éval dans votre code. Claude vous interroge et attend votre accord sur les exemples et le correcteur.

   ```
   /claude-api build-eval
   ```
3. Améliorez votre application contre elle, selon votre objectif (performance, ou coût à performance égale).

   ```
   /claude-api hillclimb
   ```

> **Le piège** Le bachotage. Si le jeu train progresse et que le jeu test reste plat, c'est un signe d'overfitting : Claude annule le changement. Ne collez jamais le contenu des échecs dans le prompt.

## Sources

- [claude.dev · Automating eval design and hillclimbing with Claude](https://claude.dev/blog/automating-eval-design-and-hillclimbing/)

rythme: [posé](https://consonance.fyi/media/lessons/automating-eval-design-and-hillclimbing/fr-pose.mp4?v=14252113) · [rapide](https://consonance.fyi/media/lessons/automating-eval-design-and-hillclimbing/fr-rapide.mp4?v=11605467)

Résumé indépendant, non affilié à Anthropic. Claude est une marque d'Anthropic, PBC. Les comparaisons « dans la vie » sont des images pour comprendre, pas des citations : chaque commande et chaque chiffre vient de la source.

## Pour continuer

- [Mode d'emploi](https://consonance.fyi/mode-d-emploi.md)
- [fiche précédente: Les mods de Claude Code : deux exemples du guide, et un vrai mod pour enregistrer son écran](https://consonance.fyi/mode-d-emploi/getting-started-with-claude-code-mods.md)
- [archives](https://consonance.fyi/archives.md)
- [méthode](https://consonance.fyi/methode.md)
- [Consonance](https://consonance.fyi/index.md)
- Langues: [English](https://consonance.fyi/en/mode-d-emploi/automating-eval-design-and-hillclimbing.md) · [Tiếng Việt](https://consonance.fyi/vi/mode-d-emploi/automating-eval-design-and-hillclimbing.md)
- Pour les machines: [llms.txt](https://consonance.fyi/llms.txt) · [RSS](https://consonance.fyi/rss.xml) · [sitemap.xml](https://consonance.fyi/sitemap.xml)
- Version HTML: https://consonance.fyi/mode-d-emploi/automating-eval-design-and-hillclimbing
