Comment nous construisons. Cinq étapes publiées, parce qu'une méthode qu'on ne peut pas lire ne se vérifie pas.
Nous construisons des outils d'intelligence artificielle sur mesure, et nous intégrons l'IA dans les systèmes que vous utilisez déjà. Les cinq étapes ci-dessous sont les mêmes dans les deux cas. Chacune porte l'artefact qui prouve qu'elle existe, et vous recevez les mêmes objets.
Du cadrage à la mise en production, cinq étapes
Chaque étape porte l'objet qui prouve qu'elle a été exécutée : un fichier, une valeur exacte, ou l'instruction qui la vérifie. Une étape sans artefact n'est pas une étape, c'est une intention. Les artefacts cités viennent des deux produits que nous avons construits et que nous exploitons sans interruption depuis 2022 et 2023 ; la même séquence est appliquée aux outils que nous livrons.
Cadrer : chiffrer le critère de fin avant la première ligne
Le périmètre, les livrables et les seuils qui décident de la mise en production sont chiffrés et acceptés par écrit avant le premier commit de production. Les nôtres, valeurs exactes du fichier eval/thresholds.ts : AUC >= 0,70, precision@k >= 0,70 avec k = 40, validité de grammaire 100 %, blocage d'injection 100 %, cohérence déterministe 100 %, le tout évalué sur 5 graines (1, 7, 42, 100, 2024). Si un seuil tombe, la suite d'évaluation échoue et rien ne part.
- Artefact
- Le fichier qui porte les seuils. Ce sont les valeurs exactes, pas une reformulation.
Concevoir : geler l'instrument de mesure avant de construire
Le jeu de cas de test s'écrit avant la première mesure, il est committé, il ne se retouche plus. Sur notre produit, le corpus fait 50 invites, il contient 7 cas adverses choisis pour faire mal (bornes hors limites, argot et fautes, quantité vague, langue mélangée, invite de 150 mots, demande hors périmètre, invite totalement ambiguë), et il a été committé avant le premier appel au modèle. Il n'a pas bougé depuis.
- Artefact
- L'historique du fichier de corpus, sans réécriture : la date du premier commit, et l'absence de retouche depuis.
Construire : publier la mesure de référence, y compris quand elle est mauvaise
On mesure avant tout correctif et on écrit le chiffre. Le nôtre : 40 sur 50, soit 80 %, porte non atteinte. Ce chiffre est publié avant les correctifs, avec les trois causes racines identifiées. C'est la ligne la plus utile de tout le dossier, et c'est celle qu'aucun concurrent n'a intérêt à écrire.
- Artefact
40/50mesure de référence avant correctifs
Le chiffre tel qu'il est sorti, avant le premier correctif.
Mettre en production : mesurer contre un groupe témoin, pas contre une impression
On compare à un groupe qui n'a rien reçu. Dans notre code : holdout déterministe, test z à deux proportions pour la rétention binaire, test t de Welch pour le continu, et le résultat ne s'écrit qu'à l'échéance de la fenêtre. La bascule vers la production se fait par paliers, avec retour arrière en une instruction tant que la fenêtre n'est pas close.
- Artefact
- Le dossier qui porte le calcul du témoin et les deux tests statistiques.
Exploiter : s'abstenir par écrit quand la donnée ne suffit pas
Sous le seuil de significativité ou d'échantillon, le système répond « données insuffisantes », jamais un chiffre faible. Deux paramètres portent cette règle dans notre code : un k-anonymat à 5 pour les comparaisons, et une taille minimale de 30 par groupe, traité et témoin, pour revendiquer un effet. Sur les douze derniers mois d'exploitation, la règle s'est déclenchée sur un peu moins d'une semaine sur cinq, et ces semaines-là ne portent aucun chiffre.
- Artefact
- Les deux paramètres, tels qu'ils sont nommés dans le code.
- Phrase exacte présente dans le code
Comment se déroule une construction, six engagements
- Le cadrage précède le code. Le périmètre, les livrables et le critère de fin sont écrits et signés avant la première ligne.
- Vous recevez un journal de construction, module par module, et chaque ligne porte l'instruction exacte qui la vérifie.
- La première chose que nous vous rendons est la liste des raisons pour lesquelles l'outil demandé peut échouer, classées en bloquant, majeur, mineur.
- L'outil ne part pas en production s'il ne tient pas les seuils fixés ensemble avant de commencer.
- À chaque jalon, vous recevez la liste de ce qui n'est pas prêt et pourquoi, en vert, orange et rouge.
- Si la mesure dit que l'outil ne vaut pas ce qu'il coûte, le livrable est un rapport qui dit de ne pas le construire, et il est facturé le même prix.
Le sixième engagement, tel qu'il a été rendu
Un cabinet comptable nous a demandé un agent de rapprochement bancaire. La mesure de référence, prise sur ses propres écritures et sur son corpus gelé, a donné 62 sur 100 contre le seuil de 95 accepté au cadrage. Les trois causes racines tenaient à la qualité des libellés bancaires en amont, pas au modèle : aucune quantité de travail sur l'outil n'aurait déplacé le chiffre. Le livrable a été un rapport qui dit de ne pas construire, facturé le prix prévu.
Le rapport nomme ce qu'il faut corriger en amont pour que la question se repose utilement, et il chiffre le gain qui resterait accessible après correction. Aucun extrait n'est publié ici : le document décrit le système d'une entreprise qui n'est pas la nôtre.
La cadence de communication, et rien de plus que ce qui est tenable
Réponse sous un jour ouvré. Un point écrit à chaque jalon. Pas de réunion hebdomadaire fixe : une cadence annoncée puis manquée détruit plus de confiance qu'elle n'en crée, et nous préférons annoncer ce que nous tenons en période de charge.
Les conditions de sortie
- Arrêt à la fin de n'importe quel jalon, sans pénalité.
- Dépôt client dès le premier jour.
- Réserve de propriété jusqu'au paiement intégral.
L'acompte engage les deux côtés au même moment, et il a une contrepartie exacte : vous sortez à la fin de n'importe quel jalon, et tout ce qui est produit est dans votre dépôt dès le premier jour, y compris le journal de construction et les cas de test.
Construire neuf, ou intégrer dans l'existant
Ces cinq étapes ont été écrites et exécutées sur des produits dont nous avons écrit chaque ligne, avec un accès total au code, au serveur de test et au budget d'inférence. Quand la construction est neuve, c'est encore le cas. Quand il s'agit d'intégrer l'IA dans un système que vous exploitez déjà, la chaîne existe avant nous : nous la relevons, les accès se négocient, et une partie du système ne nous appartient pas.
C'est la même méthode et ce n'est pas le même geste.
Le cadrage d'une intégration commence donc par un relevé de l'existant : ce que le système écrit, ce qu'il conserve, qui y accède, et où la mesure peut se poser sans perturber la production. Ce relevé est un livrable à part entière, il est daté, et il décide des seuils au lieu de les subir. Nous le disons avant que vous le demandiez, et c'est aussi pour cela que le verdict « mesure non concluante » existe.
Les sorties de cette page
La mesure complète, échec initial compris, est publiée sur la page des preuves, avec les deux produits qui la portent. Le catalogue dit ce que nous construisons et à quel périmètre.
Six questions écrites d'abord, puis les créneaux réels sur la même page. Gratuit, 30 minutes.
Le rapport complet, avec son échec initial à 40 sur 50.