RETOUR_PORTFOLIO/ETUDE_DE_CAS // RAGEVAL
OPEN-SOURCE

RAGeval

Automated RAG Benchmarking & Hallucination Detection Harness

Harnais automatisé d'évaluation de la fidélité, de la pertinence sémantique et de la robustesse des systèmes Retrieval-Augmented Generation en production.

01 // LE DÉFI TECHNIQUE & CONTEXTE DU SAHEL

La majorité des architectures RAG souffrent d'hallucinations silencieuses ou d'une sélection de chunks dégradée sans que les équipes puissent isoler l'étape défaillante.

02 // CHOIX D'ARCHITECTURE & RÉSILIENCE

Génération synthétique de jeux de tests contextuels avec scoring croisé : Faithfulness, Answer Relevance, Context Recall et détection de dérive temporelle.

03 // RÉSULTATS MESURÉS & PROTOCOLE DE BENCHMARK (PAS D'ASSERTION)

Détection d'hallucinations
91.4%

[PROTOCOLE]Corrélation directe avec l'annotation experte humaine

Campagnes de test
420 runs

[PROTOCOLE]Évaluation comparative sur 5 moteurs vectoriels

Vitesse d'évaluation
1.2s / query

[PROTOCOLE]Surcoût de jugement parallélisé multi-modèles

04 // LIMITES TECHNIQUES & COMPROMIS DE DÉPLOIEMENT

Conformément au principe déontologique de Yaçine Seybou Siddo, chaque résultat est publié à côté de ses limites connues pour une rigueur d'ingénierie absolue :

  • Résultat phare publié : le consensus multi-modèles n'a PAS dépassé le meilleur juge unique (Groq gpt-oss-120b à 0.830)
  • Le coût en tokens lors de l'évaluation dépend de la disponibilité de LLMs de jugement

Technologies & Bibliothèques Utilisées

PythonLangChainpgvectorscikit-learnTyperFastAPI

Vous souhaitez déployer une architecture similaire ?

Disponible pour des audits d'architectures RAG, des implémentations d'agents gouvernés et du conseil en optimisation de données.