cas 01
Le POC ne passe pas en production
La démo marchait sur vingt exemples choisis. Face aux vraies données et aux vrais utilisateurs, rien ne tient : latence, erreurs silencieuses, cas limites jamais prévus.
Le POC a convaincu tout le monde, puis la production a tout révélé : réponses fausses, coûts qui s’envolent, code que plus personne n’ose toucher. Nous reprenons l’existant, nous mesurons ce qui casse, et nous le rendons exploitable. Sans repartir de zéro, sans changer de modèle par réflexe.
cas 01
La démo marchait sur vingt exemples choisis. Face aux vraies données et aux vrais utilisateurs, rien ne tient : latence, erreurs silencieuses, cas limites jamais prévus.
cas 02
Le coût par requête paraissait négligeable. À l’échelle, il pèse plus que l’hébergement, et personne ne sait quelles fonctionnalités le génèrent.
cas 03
Suffisant pour une démo, intenable devant un client. Sans jeu d’évaluation, chaque correction en casse une autre et la fiabilité reste une opinion.
cas 04
L’assistant documentaire cite des procédures abrogées ou invente. Le problème est presque toujours dans la récupération, jamais dans le modèle qu’on veut remplacer.
cas 05
Prompts dispersés dans le code, dépendances à une version de SDK, aucun test. Le développeur qui l’a écrite est parti, et chaque évolution prend des semaines.
Cinq jours
Lecture du code et de l’architecture, mesure sur vos vrais cas d’usage (jeu d’évaluation constitué avec vous), analyse des coûts par fonctionnalité. Vous recevez un rapport chiffré : ce qui casse, pourquoi, et ce que coûte chaque option.
Deux jours
Un périmètre priorisé, un ordre d’attaque et un budget. Nous disons ce que nous gardons, ce que nous réécrivons et ce que nous abandonnons. Vous décidez avec des chiffres, pas avec une intuition.
En général quatre à huit semaines
Chaque sprint corrige une cause mesurée et fait progresser le score sur le jeu d’évaluation. Instrumentation, garde-fous, maîtrise des coûts et tests de non-régression arrivent en même temps que les corrections.
Une semaine
Documentation, procédures d’exploitation, formation de votre équipe sur l’évaluation continue. L’objectif est que vous puissiez faire évoluer le système sans nous.
Inclus
Non inclus
Presque jamais. Dans la majorité des projets repris, le modèle et le prompt principal sont conservés. Ce qui change, c’est ce qui les entoure : la récupération, la validation des sorties, l’instrumentation et les tests. Le diagnostic dit précisément quoi garder.
Le diagnostic de cinq jours est au forfait. La reprise est chiffrée à partir du rapport, par sprints, avec un devis envoyé sous 48 heures après le premier échange. Vous pouvez vous arrêter après le diagnostic et exécuter le plan en interne.
Avec elle. Vos développeurs participent aux sprints, relisent le code et reprennent l’évaluation continue au transfert. Un projet IA que seule une agence sait exploiter n’est pas un projet repris.
OpenAI, Anthropic, Mistral, Gemini, et les modèles open source via un fournisseur d’inférence. Côté code : TypeScript et Node.js, Next.js, Python. Bases vectorielles courantes, PostgreSQL avec pgvector, recherche hybride BM25.
Par un jeu d’évaluation de cinquante à quelques centaines de cas réels, avec des sources attendues et un seuil de mise en production défini avec vous. Le score est publié à chaque sprint. Sans ce chiffre, aucune promesse.
C’est fréquent et le diagnostic le montre vite : documents obsolètes non retirés, découpage inadapté, métadonnées absentes. Nous corrigeons le pipeline de préparation, mais nous ne produisons pas de données à votre place.
Un premier échange de trente minutes sous 48 heures. Le diagnostic démarre en général dans les deux semaines suivantes, en fonction des accès que vous pouvez donner au code et aux logs.

Un assistant documentaire qui invente des réponses n'a pas besoin d'un meilleur modèle. Voici comment isoler l'étape fautive, mesurer la récupération et corriger les six causes réelles.

Un POC IA validé qui stagne depuis six mois n'est pas un problème de modèle. Voici les six murs que le prototype n'a jamais mesurés, le diagnostic à mener en cinq jours et les trois issues possibles.

Un agent qui réussit 8 fois sur 10 en démo s'effondre en clientèle. Comment bâtir un jeu d'évaluation, mesurer la fiabilité réelle et fixer un seuil de mise en production.

Un POC IA à 40 € par mois devient une facture à 6 000 € en production. Où part réellement l'argent, comment le mesurer, et six leviers pour diviser le coût.
Racontez-nous où en est le projet, en trois lignes. Réponse sous 48 heures, un premier échange de trente minutes, puis un devis écrit.