RETOUR_PORTFOLIO/ETUDE_DE_CAS // VOICEFLOW
OPEN-SOURCE

VoiceFlow

Sahelian Speech-to-Text & Phoneme Recognition Pipeline

Système de reconnaissance vocale et de synthèse adapté aux accents sahéliens et aux phonèmes des langues locales (Haoussa, Zarma).

01 // LE DÉFI TECHNIQUE & CONTEXTE DU SAHEL

Les API vocales commerciales mondiales ont un taux d'erreur (WER) supérieur à 35% sur les accents et langues locales d'Afrique de l'Ouest.

02 // CHOIX D'ARCHITECTURE & RÉSILIENCE

Fine-tuning léger de Whisper avec injection d'un lexique phonétique local et pipeline de réduction de bruit ambiant spécialisé pour les bruits de rue.

03 // RÉSULTATS MESURÉS & PROTOCOLE DE BENCHMARK (PAS D'ASSERTION)

WER mesuré
14.2%

[PROTOCOLE]Corpus de voix sahéliennes (vs 36.8% pour le modèle de base)

Facteur temps réel (RTF)
0.24

[PROTOCOLE]Transcription 4x plus rapide que la durée audio

Débit audio requis
16 kbps

[PROTOCOLE]Audio compressé en Opus sans dégradation de reconnaissance

04 // LIMITES TECHNIQUES & COMPROMIS DE DÉPLOIEMENT

Conformément au principe déontologique de Yaçine Seybou Siddo, chaque résultat est publié à côté de ses limites connues pour une rigueur d'ingénierie absolue :

  • Un chiffre antérieur de 2.9% WER sur N=20 échantillons contrôlés est conservé pour référence ; en conditions réelles avec bruit de rue >80 dB, le WER monte à 21.5%

Technologies & Bibliothèques Utilisées

PythonPyTorchWhisperOpus CodecFastAPI

Vous souhaitez déployer une architecture similaire ?

Disponible pour des audits d'architectures RAG, des implémentations d'agents gouvernés et du conseil en optimisation de données.