Données & IA / IA documentaire
Exploiter les données avec une architecture adaptée à leur contexte.
Interroger une base documentaire et extraire des informations d’un grand corpus sont deux besoins différents. Le choix des modèles, de l’infrastructure et des outils de validation doit partir de ces usages.
01 / Le contexte
Comprendre le point de départ
Pour ChatGED chez Getlink, le besoin porte sur une base de plusieurs dizaines de milliers de directives ferroviaires. Un autre projet, distinct, porte sur l’extraction de données structurées à partir d’une base de 27 millions de commentaires, sans service IA externe.
02 / L’intervention
Du cadrage à la réalisation
- ChatGED / Getlink : ateliers avec les parties prenantes et clarification des objectifs et contraintes.
- ChatGED / Getlink : conception d’une architecture de chatbot RAG compatible avec le SI Azure du client.
- Projet de data mining local : benchmark de modèles open-weight, notamment GPT-OSS, Ministral, Qwen et Gemma, sur une machine de 128 Go.
- Projet de data mining local : comparaison d’Ollama, llama.cpp et vLLM, optimisation des prompts et développement d’outils d’analyse et de visualisation des résultats.
03 / Les résultats et leur périmètre
Architecture et validation des usages
La mission ChatGED couvre le cadrage et la conception d’architecture. Le projet de data mining documente les expérimentations, les benchmarks et l’outillage de validation. Les 27 millions de commentaires représentent la taille de la base étudiée, et non un volume déclaré intégralement traité.
Choisir une architecture IA, c’est aussi définir où circulent les données et comment vérifier la qualité des résultats.
Parlons de votre contexte
Un logiciel à faire évoluer.
Un sujet à débloquer.
Décrivez-moi votre situation, vos contraintes et ce que vous souhaitez faire avancer. Nous pourrons identifier une première étape.
Vous échangez directement avec
Grégoire Piffault, ingénieur logiciel indépendant.