Mesures des 8 et 9 octobre 2026

Résultats et méthode

Tous nos chiffres, avec leurs limites. Ils viennent de jeux de test que les modèles n'ont pas vus pendant l'entraînement ; quand un test est moins propre qu'il n'y paraît, nous le disons.

Reconnaissance de la parole

Transcripteur v4

Base : famille w2v-BERT 2.0 (licence MIT), entraînée par nos soins pour le baoulé. Mesure : le taux de caractères erronés (CER) et de mots erronés (WER), après mise en minuscules et suppression de la ponctuation ; les tons sont conservés. Plus bas est meilleur.

10,3 %CER, locuteurs jamais entendus

553 phrases lues au téléphone par 4 locuteurs absents de l'entraînement. WER 28,3 %.

11,2 %CER mesuré à travers l'API

Même test, par notre serveur, espaces non comptés. IC 95 % [10,5 – 11,8]. WER 28,3 % [26,9 – 29,9].

Évaluation hors ligne du transcripteur v4 (9 octobre 2026)
Jeu de testExtraitsCERWER
Téléphone, locuteurs jamais entendus55310,3 %28,3 %
Enregistrements de terrain, jeu de test public4798,4 %25,7 %
Phrases lues par des bénévoles, jeu de test public ¹5628,0 %20,1 %
Textes lus, jeu de test public ²1924,1 %11,6 %
Lecture biblique, livres tenus à l'écart4204,1 %9,8 %

Dans ce tableau, le CER compte les espaces comme des caractères. ¹ Phrases différentes de l'entraînement, mais les 15 locuteurs de ce test figurent aussi dans nos données d'entraînement : chiffre optimiste. ² Même genre de textes que le test « téléphone » ; ce jeu ne permet pas de vérifier si ses locuteurs apparaissent aussi dans sa partie d'entraînement.

Mesure à travers l'API (9 octobre 2026, intervalles de confiance à 95 %)
Jeu de testCER sans espacesCER avec espacesWER
Téléphone, locuteurs jamais entendus (553)11,2 % [10,5 – 11,8]10,3 % [9,7 – 10,9]28,3 % [26,9 – 29,9]
Phrases lues par des bénévoles (562) ¹8,7 % [7,7 – 10,0]8,0 % [7,0 – 9,2]19,9 % [18,3 – 21,7]

Recoupements de texte

Une vérification automatique compare le test « téléphone » à tout ce qui a servi à l'entraînement. Aucun enregistrement ni locuteur commun. Mais 16 phrases du test existent telles quelles dans nos textes d'entraînement (13 sont des expressions d'un à trois mots, 3 des phrases complètes présentes dans des données d'entraînement antérieures), et 3 sont presque identiques.

Même genre de textes

Le test « téléphone » et l'un de nos jeux d'entraînement ajoutés pour la v4 sont des lectures du même genre de textes. Les phrases identiques ou presque ont été retirées de l'entraînement, mais une partie du progrès sur ce test peut venir de cette ressemblance.

Deux définitions du CER

Notre évaluation interne compte les espaces ; le banc d'essai de l'API ne les compte pas. Mesurés de la même façon, l'API et l'évaluation interne donnent le même résultat (10,3 %).

Traduction

Baoulé ↔ français

Jeu de test « vie courante » : 316 paires de phrases jamais vues à l'entraînement. Mesure : chrF++ (ressemblance des caractères et des mots avec une traduction de référence humaine, de 0 à 100). Plus haut est meilleur. Le baoulé est noté sans les marques de ton.

Jeu de test « vie courante », 316 phrases, chrF++
ModèleBase et licencebaoulé → françaisfrançais → baoulé
Commercial (5ᵉ version, 9 octobre)Famille MADLAD-400, licence Apache 2.0 : utilisable commercialement34,734,1
Recherche (3ᵉ version, 8 octobre)Famille NLLB-200, licence non commerciale (CC BY-NC 4.0)32,338,0
  • Intervalles de confiance. Mesuré à travers l'API, le modèle Recherche obtient 32,2 [30,3 – 34,3] et 37,5 [35,5 – 39,6] (le serveur décode avec des réglages légèrement différents). Pour le modèle Commercial, le gain sur sa version précédente est de +1,6 [0,6 – 2,6] vers le français et de +2,2 [1,2 – 3,2] vers le baoulé (rééchantillonnage, 1 000 tirages).
  • Lequel choisir ? Le modèle Recherche est le meilleur vers le baoulé ; le modèle Commercial est le meilleur vers le français et le seul utilisable dans un produit payant.
Détail par partie du test (chrF++)
PartiePhrasesCommercial bci → fraCommercial fra → bciRecherche bci → fraRecherche fra → bci
Conversation libre16631,629,728,232,2
Exemples de dictionnaire11237,438,837,347,0
Questions-réponses sur la santé3843,846,543,453,1
Autres registres (chrF++)
RegistrePhrasesCommercial bci → fraCommercial fra → bciRecherche bci → fraRecherche fra → bci
Contes5423,125,720,628,4
Bible, passages tenus à l'écart22737,835,047,439,5

Un test proche de l'entraînement

Les phrases du test viennent des mêmes sources (mêmes documents, mêmes locuteurs) qu'une partie des données d'entraînement. Les phrases elles-mêmes sont différentes : toute paire d'entraînement identique ou très proche (90 % de ressemblance ou plus) d'une phrase de test a été retirée. Les chiffres sont donc plutôt optimistes.

Notre point faible

Notre partie la plus faible est la conversation libre, et les contes le sont plus encore. C'est exactement ce que le programme Voix Baoulé doit améliorer : de vraies conversations, dans de vraies conditions.

Des tests encore petits

316 phrases, c'est peu : un écart d'un ou deux points entre deux modèles peut tenir au hasard. Il n'existe pas encore de jeu de test public de référence pour le baoulé ; nous en construisons un.

Notre méthode

Quatre étapes, les mêmes pour la parole et pour le texte.

  1. 1. Rassembler

    Livres bilingues numérisés et lus par notre OCR, enregistrements publics avec leur texte, puis nos propres enregistrements, consentis et rémunérés.

  2. 2. Unifier l'orthographe

    Les textes anciens sont convertis vers l'orthographe moderne (ɛ, ɔ…). Chaque règle est mesurée : sur un corpus d'essai de 14 499 mots, la conversion finale reconnaît 88,9 % des mots, contre 70,8 % avec des règles simples.

  3. 3. Vérifier l'alignement

    Chaque extrait audio est aligné sur son texte et noté, chaque phrase sur sa traduction ; les paires douteuses sont écartées avant l'entraînement, et des échantillons sont relus à la main.

  4. 4. Mesurer à l'écart

    Les jeux de test sont séparés avant l'entraînement ; un contrôle automatique cherche les enregistrements, locuteurs et phrases en commun ; chaque score est donné avec son intervalle de confiance (1 000 rééchantillonnages).

Ce que nous ne publions pas

Nous ne publions ni les poids de nos modèles, ni la liste détaillée de nos sources de données, ni le détail de nos chaînes de traitement. Une question sur ces mesures ? Écrivez à contact@abyshire.ci.

Dernière mise à jour : 10 octobre 2026.