LLM sur mesure : fine-tuning et RAG sur vos données
Vous n'avez pas besoin d'entraîner un modèle. Vous avez besoin d'un modèle qui connaît vos documents, votre vocabulaire et vos règles.
La demande arrive presque toujours formulée de la même façon : « on voudrait entraîner notre propre IA ». Dans neuf cas sur dix, ce n'est pas ce dont l'entreprise a besoin — et c'est une bonne nouvelle, parce que ce dont elle a besoin coûte dix à cinquante fois moins cher.
Entraîner un modèle depuis zéro (pré-entraînement) coûte des millions de dollars en calcul et n'a de sens que pour une poignée de laboratoires. Ce qui répond réellement au besoin s'appelle soit le RAG — le modèle consulte vos documents au moment de répondre — soit le fine-tuning — on spécialise un modèle existant sur vos exemples. Le premier suffit dans la majorité des cas.
RAG, fine-tuning, ou les deux ?
| RAG | Fine-tuning | Pré-entraînement | |
|---|---|---|---|
| Ce que ça change | Le modèle lit vos documents avant de répondre | Le modèle apprend votre style, vos formats, vos catégories | Le modèle apprend le langage lui-même |
| Bon pour | Base de connaissance, support, documentation, catalogue | Ton de marque, classification, extraction, format de sortie strict | Rien, pour 99,9 % des entreprises |
| Mise à jour | Immédiate — vous ajoutez un document | Nécessite un réentraînement | Impossible en pratique |
| Sources citables | Oui, avec la référence exacte | Non | Non |
| Coût typique | 17 500 – 42 000 MAD | 55 000 MAD et plus | Millions de dollars |
| Délai | 3 à 6 semaines | 6 à 12 semaines | Sans objet |
Ce que nous construisons concrètement
Assistant sur base documentaire
Vos procédures, contrats, fiches techniques, historique de tickets. L'assistant répond en citant la source exacte, et dit « nous ne savons pas » quand l'information n'existe pas — ce qui est le comportement difficile à obtenir.
Extraction et classification
Transformer des documents non structurés — factures, CV, contrats, emails — en données exploitables. C'est le cas où le fine-tuning bat nettement le prompt, et où le retour sur investissement est le plus facile à chiffrer.
Modèle métier spécialisé
Un modèle ouvert (Llama, Mistral, Qwen) spécialisé sur votre domaine et hébergé chez vous. Pour les secteurs où aucune donnée ne peut sortir : santé, juridique, financier, défense.
La souveraineté des données, en trois niveaux
C'est la question qui décide de l'architecture, et elle se pose avant toute considération technique.
Niveau 1 — API commerciale. Claude, GPT ou Gemini via leur offre entreprise, dont les conditions excluent contractuellement l'entraînement sur vos données. Le moins cher, le plus performant, suffisant pour la plupart des usages internes non réglementés.
Niveau 2 — Hybride. Les données sensibles sont anonymisées ou traitées localement, seul le reste passe par l'API. Un bon compromis quand une minorité de vos documents est réellement confidentielle.
Niveau 3 — Souverain. Un modèle ouvert tourne sur votre serveur ou sur un serveur au Maroc. Rien ne sort. Le coût d'infrastructure est réel — comptez un GPU dédié — mais la question de la confidentialité disparaît complètement.
L'évaluation, pas la démonstration
Une démonstration d'IA marche toujours : on choisit trois questions, elles ont de bonnes réponses, tout le monde est convaincu. La production est un exercice différent, et c'est là que la plupart des projets se cassent.
Chaque système que nous livrons part avec un jeu d'évaluation construit sur vos vraies questions, avec les réponses attendues validées par vos experts. On mesure le taux de réponse correcte, le taux d'hallucination, et le taux d'abstention — la capacité à dire « nous ne savons pas ». Ces trois nombres sont dans le contrat, et ils sont mesurés sur des questions que le système n'a jamais vues pendant sa construction.
Sans jeu d'évaluation, vous n'avez pas un système, vous avez une impression.