Dans cette fiche, tu en apprendras davantage sur la reconnaissance vocale et la synthèse vocale, le rôle de l’IA dans ces technologies et sur la façon dont elles peuvent t’aider dans tes apprentissages.
La reconnaissance vocale et la synthèse vocale sont deux technologies qui permettent d’interagir avec les ordinateurs et les appareils.
- La reconnaissance vocale, ou speech-to-text (STT) en anglais, transforme la voix humaine en texte écrit.
- La synthèse vocale, ou text-to-speech (TTS) en anglais, transforme le texte écrit en voix artificielle.
Voici quelques exemples d’applications de ces technologies.
Bien qu’elle soit super pratique, ce n’est pas toujours facile d’utiliser la recherche vocale. Voici quelques trucs pour toi!
Assure-toi que ta recherche vocale est optimale et bien comprise grâce aux 6 trucs suivants.
- Pense à ce que tu vas dire avant de cliquer sur le bouton.
- Utilise des mots-clés pertinents.
- Évite les informations superflues.
- Parle clairement.
- Parle à une vitesse normale.
- Évite les bruits ambiants.
La plupart des technologies de reconnaissance vocale et de synthèse vocale utilisent l’intelligence artificielle (IA). On t’explique comment ça fonctionne.
- Une très grande quantité de données de texte et de voix humaines libres de droits sont sauvegardées dans des centres de données.
- Ces données sont utilisées pour entrainer l’IA à associer les sons à du texte écrit.
Par exemple, l’IA apprend que le son « ch » dans le mot schéma et dans le mot changement ne s’écrit pas de la même façon. Plus l’IA a de données pour s’entrainer, plus elle devient précise. - Une fois entrainée, l’IA suit un ensemble de règles qui lui permettent de faire des prédictions. C’est ce qu’on appelle des algorithmes.
- Quand tu utilises la reconnaissance vocale, elle capte ta voix, elle la soumet aux algorithmes, puis elle prédit le texte à écrire.
- Une très grande quantité de données de texte et de voix humaines libres de droits sont sauvegardées dans des centres de données.
- Ces données sont utilisées pour entrainer l’IA à associer le texte écrit à des sons.
Par exemple, l’IA apprend que lorsqu’il y a une virgule, la voix artificielle doit faire une pause. - Une fois entrainée, l’IA suit des algorithmes.
- Quand tu utilises la synthèse vocale, elle analyse le texte écrit à l’aide des algorithmes, puis elle prédit les sons à produire par la voix artificielle.
Sur Alloprof, la barre de recherche offre la fonctionnalité Chercher avec la voix.
Il s’agit de la technologie de Google Cloud appelée Speech-to-Text.
Pour l’utiliser, il suffit de cliquer sur le bouton en forme de micro avant de parler.
Non.
En utilisant Chercher avec la voix sur Alloprof, tes données de voix ne sont pas sauvegardées. Elles ne serviront pas à entrainer l’intelligence artificielle de Google.
Toutefois, d’autres applications pourraient sauvegarder tes données de voix pour une courte durée afin d’entrainer leur modèle. Pour faire cela, on devrait toujours te demander ton consentement. De plus, tes données de voix devraient être anonymisées. Cela signifie qu’il serait impossible d’identifier qu’il s’agit de ta voix. Ceci est très important pour assurer la protection de tes données personnelles.
Afin de reconnaitre une variété de voix humaines (timbre, intonation, accent) et de produire des voix artificielles réalistes, un très grand nombre de données sont nécessaires. Google utilise des données sous forme d’enregistrements audios qui proviennent surtout :
- d’acteurs professionnels dont la voix a été enregistrée en studio;
- de contenus publics comme :
- des livres audios libres de droits;
- des émissions de télé;
- des discours publics;
- etc.
- d’utilisateurs qui ont donné leur consentement.
Afin de t’offrir la meilleure expérience possible, Alloprof utilise plusieurs technologies différentes, telles que celle de Google Cloud Text-to-Speech et celle de ElevenLabs.
Tu peux retrouver de la synthèse vocale dans les fiches de :
- français;
- anglais langue seconde;
- histoire;
- géographie;
- monde contemporain;
- éducation financière.
Pour l’utiliser, il faut cliquer sur le bouton en forme de hautparleur.
Bien qu’elles soient pratiques pour tout le monde, la reconnaissance vocale et la synthèse vocale sont d’une grande aide pour les gens qui ont de la difficulté à écrire et à lire, et ce, pour toutes sortes de raisons. En voici quelques exemples.
- Les troubles de la vue
Ex. Une personne aveugle ou malvoyante peut utiliser la synthèse vocale pour écouter le contenu d’une page web. - Les troubles auditifs
Ex. Une personne sourde ou malentendante peut lire les sous-titres générés automatiquement dans une vidéo. - Les handicaps moteurs temporaires ou permanents
Ex. Une personne avec une blessure à la main peut rédiger un texte grâce à la reconnaissance vocale. - L’apprentissage d’une nouvelle langue
Ex. Deux personnes ne parlant pas la même langue peuvent communiquer grâce à des applications de traduction qui comprennent de la reconnaissance et de la synthèse vocale. - Les troubles d’apprentissage (ex. dyslexie, dysorthographie, dyspraxie)
Ex. Grâce à la synthèse vocale, une personne peut écouter les mots au fur et à mesure qu’elle écrit. Ceci permet de détecter plus facilement les erreurs d’orthographe.
Source : Xavier Lorenzo, Shutterstock.com
À l’école, des outils technologiques peuvent te permettre de réaliser et de démontrer tes apprentissages en réduisant les obstacles liés à une condition personnelle comme un trouble d’apprentissage.
Les logiciels utilisés à l’école les plus communs sont WordQ (reconnaissance et synthèse vocale) et Lexibar (synthèse vocale). Ces outils n’empêchent pas que tu doives prendre des décisions basées sur tes apprentissages, mais ils aident, entre autres, à :
- augmenter la quantité de mots écrits;
- décoder les mots;
- écouter un texte à une vitesse qui permet de bien comprendre le sens.
En plus des fonctionnalités de reconnaissance et de synthèse vocale, ces outils utilisent d’autres technologies d’IA pour :
- prédire les prochains mots d’une phrase;
- détecter les erreurs d’orthographe.
- Google. (2025) Gemini 2.5 Flash [grand modèle de langage]. https://gemini.google.com/app
- Google Cloud. (s. d.). Google Cloud Text-to-Speech. Google Cloud. Consulté le 3 novembre 2025, à l’adresse https://cloud.google.com/text-to-speech?hl=fr
- Google Cloud. (s. d.). Google Cloud Speech-to-Text. Google Cloud. Consulté le 3 novembre 2025, à l’adresse https://cloud.google.com/speech-to-text?hl=fr
- Institut TA. (s. d.). WordQ et Lexibar : comment ces logiciels peuvent-ils aider mon enfant. Institut TA. Consulté le 28 octobre 2025, à l’adresse https://www.institutta.com/s-informer/wordq-et-lexibar-comment-ces-logiciels-peuvent-ils-aider-mon-enfant#les-fonctions-daide-disponibles-dans-les-deux-logiciels