Aller au contenu
Notes
·
ragpmefiabilité

RAG pour PME : ce qui marche vraiment vs la démo

msns

Le RAG impressionne en démo et déçoit souvent en vrai. Les écarts concrets, et comment les combler pour une PME.

Le RAG (donner à un LLM vos documents pour qu’il réponde dessus) est la brique la plus utile pour une PME. Et la plus mal faite.

Pourquoi la démo ment

En démo, on prend 5 documents propres et 3 questions choisies. Forcément ça marche. En vrai, vous avez des centaines de documents hétérogènes, des doublons, des versions obsolètes, et des utilisateurs qui posent des questions qu’on n’avait pas prévues.

Ce qui fait la différence en production

La qualité de la récupération > la taille du modèle. Si on récupère le mauvais passage, le meilleur LLM répondra une bêtise avec aplomb. 80 % du travail utile est dans l’indexation et la récupération, pas dans le prompt.

Le découpage des documents. Trop gros : le contexte est dilué. Trop petit : on perd le sens. Le bon découpage dépend de vos documents, ça se règle, ça ne s’improvise pas.

Le droit de dire « je ne sais pas ». Un assistant utile refuse de répondre hors périmètre plutôt que d’inventer. C’est contre-intuitif, mais c’est ce qui crée la confiance.

La fraîcheur. Vos documents évoluent. Sans réindexation, l’assistant répond avec des infos périmées. Le « run » n’est pas optionnel.

Les droits d’accès. Tout le monde ne doit pas tout voir. La récupération doit respecter le périmètre de chaque utilisateur, sinon c’est une fuite de données déguisée.

Pour une PME, concrètement

Pas besoin d’une usine à gaz. Un RAG bien réglé sur vos vraies sources, avec des garde-fous et une réindexation régulière, apporte plus de valeur qu’un système clinquant qu’on ne maintient pas. La vraie question n’est pas « quel modèle », mais « est-ce que ça répondra juste, dans 6 mois, sur mes données à moi ».

Un cas similaire ?

Si ce sujet touche un projet chez vous, on peut en parler concrètement.

Me contacter