LLM sur mesure : fine-tuning et RAG sur vos données

Vous n'avez pas besoin d'entraîner un modèle. Vous avez besoin d'un modèle qui connaît vos documents, votre vocabulaire et vos règles.

À partir de 17 500 MAD 3 à 8 semaines Vos données restent les vôtres

La demande arrive presque toujours formulée de la même façon : « on voudrait entraîner notre propre IA ». Dans neuf cas sur dix, ce n'est pas ce dont l'entreprise a besoin — et c'est une bonne nouvelle, parce que ce dont elle a besoin coûte dix à cinquante fois moins cher.

Entraîner un modèle depuis zéro (pré-entraînement) coûte des millions de dollars en calcul et n'a de sens que pour une poignée de laboratoires. Ce qui répond réellement au besoin s'appelle soit le RAG — le modèle consulte vos documents au moment de répondre — soit le fine-tuning — on spécialise un modèle existant sur vos exemples. Le premier suffit dans la majorité des cas.

RAG, fine-tuning, ou les deux ?

RAGFine-tuningPré-entraînement
Ce que ça changeLe modèle lit vos documents avant de répondreLe modèle apprend votre style, vos formats, vos catégoriesLe modèle apprend le langage lui-même
Bon pourBase de connaissance, support, documentation, catalogueTon de marque, classification, extraction, format de sortie strictRien, pour 99,9 % des entreprises
Mise à jourImmédiate — vous ajoutez un documentNécessite un réentraînementImpossible en pratique
Sources citablesOui, avec la référence exacteNonNon
Coût typique17 500 – 42 000 MAD55 000 MAD et plusMillions de dollars
Délai3 à 6 semaines6 à 12 semainesSans objet
En pratique, la combinaison la plus efficace est un RAG solide plus un fine-tuning léger sur le format de sortie. On commence toujours par le RAG : il est mesurable et corrigible.

Ce que nous construisons concrètement

RAG

Assistant sur base documentaire

Vos procédures, contrats, fiches techniques, historique de tickets. L'assistant répond en citant la source exacte, et dit « nous ne savons pas » quand l'information n'existe pas — ce qui est le comportement difficile à obtenir.

Fine-tuning

Extraction et classification

Transformer des documents non structurés — factures, CV, contrats, emails — en données exploitables. C'est le cas où le fine-tuning bat nettement le prompt, et où le retour sur investissement est le plus facile à chiffrer.

Souverain

Modèle métier spécialisé

Un modèle ouvert (Llama, Mistral, Qwen) spécialisé sur votre domaine et hébergé chez vous. Pour les secteurs où aucune donnée ne peut sortir : santé, juridique, financier, défense.

La souveraineté des données, en trois niveaux

C'est la question qui décide de l'architecture, et elle se pose avant toute considération technique.

Niveau 1 — API commerciale. Claude, GPT ou Gemini via leur offre entreprise, dont les conditions excluent contractuellement l'entraînement sur vos données. Le moins cher, le plus performant, suffisant pour la plupart des usages internes non réglementés.

Niveau 2 — Hybride. Les données sensibles sont anonymisées ou traitées localement, seul le reste passe par l'API. Un bon compromis quand une minorité de vos documents est réellement confidentielle.

Niveau 3 — Souverain. Un modèle ouvert tourne sur votre serveur ou sur un serveur au Maroc. Rien ne sort. Le coût d'infrastructure est réel — comptez un GPU dédié — mais la question de la confidentialité disparaît complètement.

L'évaluation, pas la démonstration

Une démonstration d'IA marche toujours : on choisit trois questions, elles ont de bonnes réponses, tout le monde est convaincu. La production est un exercice différent, et c'est là que la plupart des projets se cassent.

Chaque système que nous livrons part avec un jeu d'évaluation construit sur vos vraies questions, avec les réponses attendues validées par vos experts. On mesure le taux de réponse correcte, le taux d'hallucination, et le taux d'abstention — la capacité à dire « nous ne savons pas ». Ces trois nombres sont dans le contrat, et ils sont mesurés sur des questions que le système n'a jamais vues pendant sa construction.

Sans jeu d'évaluation, vous n'avez pas un système, vous avez une impression.

3
métriques contractuelles : exactitude, hallucination, abstention
100 %
évalué sur des questions jamais vues au développement
2 sem.
pour un prototype mesurable sur vos données

Questions fréquentes

Quelle est la différence entre RAG et fine-tuning ?
Le RAG donne au modèle accès à vos documents au moment où il répond : il cherche les passages pertinents et s'appuie dessus, en citant la source. Le fine-tuning modifie les poids du modèle pour lui apprendre un comportement — un ton, un format, une taxonomie. Le RAG répond à « le modèle ne connaît pas mes informations » ; le fine-tuning répond à « le modèle ne répond pas comme nous voulons ». Les deux besoins sont distincts et les solutions ne sont pas interchangeables.
Combien coûte un LLM sur mesure pour une entreprise ?
Un assistant RAG en production sur vos documents se situe entre 17 500 et 42 000 MAD selon le volume documentaire et les intégrations. Un fine-tuning avec jeu d'évaluation dépasse généralement 53 500 MAD. Un déploiement souverain sur votre infrastructure ajoute le coût du GPU, qu'il soit acheté ou loué. Le cadrage donne une fourchette ferme avant tout engagement.
Quels modèles utilisez-vous ?
Claude et GPT quand la performance prime et que la confidentialité le permet ; Llama, Mistral et Qwen quand le déploiement doit rester chez vous. Le choix se fait sur votre cas mesuré, pas sur une préférence : nous testons généralement deux à trois modèles sur votre jeu d'évaluation avant de trancher, et le moins cher gagne souvent.
Faut-il beaucoup de données pour faire du fine-tuning ?
Moins qu'on ne le croit. Avec les méthodes LoRA et QLoRA, quelques centaines à quelques milliers d'exemples de bonne qualité suffisent pour la plupart des tâches de format et de classification. Le facteur limitant est la qualité et la cohérence des exemples, pas leur nombre — mille exemples propres battent cinquante mille exemples contradictoires.
En combien de temps peut-on avoir un premier résultat ?
Deux semaines pour un prototype testable sur un échantillon réel de vos données, avec des chiffres. C'est volontairement court : l'objectif est de savoir si le projet tient avant d'engager le budget complet. Si le prototype ne passe pas la barre fixée au cadrage, on arrête là et vous n'avez perdu que deux semaines.

Parlons de votre projet.

Décrivez votre besoin et recevez une proposition chiffrée sous 24 h. Le premier échange est gratuit et sans engagement — il arrive qu'il conclue qu'il n'y a pas de levier, et c'est une réponse utile.