VoiceFlow
Sahelian Speech-to-Text & Phoneme Recognition Pipeline
Système de reconnaissance vocale et de synthèse adapté aux accents sahéliens et aux phonèmes des langues locales (Haoussa, Zarma).
01 // LE DÉFI TECHNIQUE & CONTEXTE DU SAHEL
Les API vocales commerciales mondiales ont un taux d'erreur (WER) supérieur à 35% sur les accents et langues locales d'Afrique de l'Ouest.
02 // CHOIX D'ARCHITECTURE & RÉSILIENCE
Fine-tuning léger de Whisper avec injection d'un lexique phonétique local et pipeline de réduction de bruit ambiant spécialisé pour les bruits de rue.
03 // RÉSULTATS MESURÉS & PROTOCOLE DE BENCHMARK (PAS D'ASSERTION)
[PROTOCOLE]Corpus de voix sahéliennes (vs 36.8% pour le modèle de base)
[PROTOCOLE]Transcription 4x plus rapide que la durée audio
[PROTOCOLE]Audio compressé en Opus sans dégradation de reconnaissance
04 // LIMITES TECHNIQUES & COMPROMIS DE DÉPLOIEMENT
Conformément au principe déontologique de Yaçine Seybou Siddo, chaque résultat est publié à côté de ses limites connues pour une rigueur d'ingénierie absolue :
- •Un chiffre antérieur de 2.9% WER sur N=20 échantillons contrôlés est conservé pour référence ; en conditions réelles avec bruit de rue >80 dB, le WER monte à 21.5%
Technologies & Bibliothèques Utilisées
Vous souhaitez déployer une architecture similaire ?
Disponible pour des audits d'architectures RAG, des implémentations d'agents gouvernés et du conseil en optimisation de données.