Réglages → Voix
Tout ce que Mnemosyne OS fait avec le son se règle ici : comment il vous entend (micro et transcription), comment il parle (la voix de lecture), et comment se comporte l'assistant vocal ∞. L'entrée du rail s'appelle Voix ; le sous-titre de la page dit Saisie vocale (dictée) et voix de réponse (lecture, dont ElevenLabs).
Chaque contrôle de cette page s'enregistre dès qu'on le touche. Il n'y a pas de bouton Enregistrer.
Pour ce que la voix fait une fois réglée, voir Calliope, la voix. Cette page parle des réglages.
Microphone
La première cause d'une transcription absurde (une réponse réduite à « you ») est un micro muet, donc la page s'ouvre sur un vumètre en direct.
- Un sélecteur liste Microphone par défaut du système et chaque entrée que l'OS connaît. Les noms des périphériques apparaissent une fois la permission micro accordée.
- Tester le micro lance le vumètre ; le bouton devient Arrêter le test. Pendant le test, la page dit Parle maintenant — la barre doit bouger. La barre reste grise sous un murmure, passe à l'ambre à bas niveau, au vert quand le signal est bon, et indique la Crête atteinte.
- Aucun signal détecté — mauvais périphérique d'entrée ou micro coupé ? veut dire que la crête n'a jamais quitté zéro : changez de périphérique dans le sélecteur, ou réactivez le micro.
- Accès au micro refusé. Autorise-le dans Windows → Confidentialité → Microphone. est un refus de l'OS, pas de l'app.
Rien n'est enregistré pendant le test. C'est un vumètre, rien d'autre.
Moteur par défaut (transcription)
Deux cartes choisissent comment votre parole devient du texte :
- Local (Whisper) : Hors-ligne, privé. Nécessite un modèle téléchargé. Sous la carte, une ligne nomme le Modèle actif et dit s'il est prêt à l'emploi ou non téléchargé — ouvrez Avancé pour l'obtenir.
- Cloud : Prêt · openai (ou gemini) quand votre fournisseur d'IA actif sait transcrire, sinon Nécessite une clé OpenAI/Gemini. Carte sélectionnée, une ligne dit Transcription via ton modèle configuré : OpenAI whisper-1 (ou Gemini). Si votre modèle cloud actif ne transcrit pas l'audio, la ligne passe à l'ambre : Ton modèle cloud actif ne transcrit pas l'audio. Configure OpenAI ou Gemini dans IA & Modèles.
Si vous choisissez Cloud mais qu'aucune clé ne sait transcrire, un modèle local téléchargé est utilisé quand même. Le choix ici est une préférence, jamais un moyen de perdre la dictée.
Avancé — gérer les modèles
Replié par défaut ; il s'ouvre tout seul pendant un téléchargement pour que la progression reste visible. Deux paliers :
Modèles locaux (Whisper), qui tournent dans l'app :
| Modèle | Taille | La note de l'app |
|---|---|---|
| Whisper Tiny | ~75 MB | Le plus rapide et léger — précision moindre. Multilingue. |
| Whisper Base | ~150 MB | Équilibre vitesse/précision. Multilingue. |
| Whisper Small | ~250 MB | Bonne précision, vitesse raisonnable. Multilingue. |
| Distil-Whisper (EN) | ~180 MB | Rapide et précis, anglais uniquement. |
Grands modèles (moteur vocal GPU), qui tournent dans un processus séparé :
| Modèle | Taille | La note de l'app |
|---|---|---|
| Whisper Medium | ~1.5 GB | Haute précision, multilingue. |
| Whisper Large v3 Turbo ★ | ~1.6 GB | Précision proche de large-v3, bien plus rapide. Recommandé. |
| Whisper Large v3 | ~3 GB | Précision maximale, multilingue. Le modèle le plus lourd. |
Cliquez une ligne pour en faire le modèle actif ; Télécharger le récupère. Pour un grand modèle, le premier Télécharger installe d'abord le moteur vocal GPU (le bouton dit Installation 40 %, puis Téléchargement 40 %). La ligne d'état au-dessus du palier décrit la machine où vous êtes :
- Télécharger un modèle ci-dessous installe le moteur GPU automatiquement la première fois (une seule fois, nécessite Python 3.10+). L'accélération GPU nécessite une carte graphique NVIDIA (CUDA) — les autres machines transcrivent sur le processeur.
- Moteur vocal GPU installé · CUDA une fois qu'il tourne sur la carte.
- GPU NVIDIA détecté — activez l'accélération pour une transcription bien plus rapide. avec un bouton Activer le GPU, quand la carte est là mais pas encore les bibliothèques CUDA (environ 800 Mo, téléchargées une fois).
- Aucun GPU CUDA détecté : les grands modèles s'exécuteront sur le processeur (plus lent). sur toute autre machine. Les grands modèles y marchent quand même, seulement plus lentement.
Un modèle téléchargé affiche Téléchargé et une corbeille. La corbeille demande Supprimer ? et propose Supprimer / Annuler avant de retirer quoi que ce soit.
Sortie vocale (lecture)
Trois cartes choisissent la voix qui lit les réponses à voix haute, dans le chat, dans la conversation ∞ et dans MnemoReader :
- Système (hors-ligne) : Privé, gratuit, robotique. Les voix intégrées à votre OS, rien à télécharger.
- Neural local : Naturelle, gratuite, offline. Téléchargeable. Des moteurs qui tournent sur votre machine, décrits plus bas.
- ElevenLabs (cloud) : Voix naturelle. Nécessite une clé ; le texte quitte la machine.
ElevenLabs : entrer votre clé API
- Créer une clé chez ElevenLabs
Dans votre compte ElevenLabs, ouvrez la page des clés API (elle se trouve sous le menu de votre profil) et créez une clé. Copiez-la tout de suite : ElevenLabs ne la montre qu'une fois. Si vous restreignez ce que la clé a le droit de faire, il lui faut la synthèse vocale et la lecture de vos voix.
- Sélectionner la carte ElevenLabs (cloud)
Ouvrez Réglages → Voix, descendez jusqu'à Sortie vocale (lecture) et cliquez ElevenLabs (cloud). Un champ Clé API ElevenLabs apparaît sous les cartes.
- Coller la clé
Collez-la dans le champ. C'est un champ de mot de passe, les caractères restent masqués, et il s'enregistre pendant que vous tapez. Il n'y a aucun bouton Enregistrer à presser.
- Charger les voix
Cliquez Charger les voix. Le bouton reste grisé tant que le champ est vide. Les voix de votre compte apparaissent dans une liste déroulante à côté, la première déjà sélectionnée. Si la clé est fausse, l'erreur renvoyée par ElevenLabs s'imprime en rouge sous le champ.
- Tester la voix
Une voix sélectionnée, Tester la voix prononce une phrase complète dans la langue de votre interface, au volume de lecture réglé plus bas sur la page.
- Choisir le modèle
Deux boutons choisissent le modèle ElevenLabs : Qualité (Voix la plus riche · 1 crédit/car.) ou Éco + rapide (~½ du coût · moins de latence). Ces crédits sont des crédits ElevenLabs, facturés par ElevenLabs.
La clé reste sur votre machine, dans les réglages de l'app, et n'est envoyée qu'à ElevenLabs, avec chaque requête. La carte le dit sans détour : avec ce moteur, le texte de chaque réponse lue à voix haute quitte votre machine.
Neural local
Neural local sélectionné, une ligne dit quel moteur parle (Lecture avec : Piper), puis une carte par moteur :
| Moteur | Taille | La note de l'app |
|---|---|---|
| Piper | ~290 MB | Français, espagnol et anglais naturels · hors ligne |
| XTTS-v2 (voice cloning) | ~5 GB | Clone votre voix · FR/ES/EN · GPU · nécessite Python |
| Chatterbox | ~4,5 GB | Expressif · 23 langues · clone votre voix · GPU · nécessite Python |
| Zonos-v0.1 | ~5,5 GB | Vecteur d'émotion · FR/ES/EN/DE/ZH/JA · 6 Go de VRAM · nécessite Python |
Zonos est grisé et marqué Bientôt : il est garé, pas installable.
Les voix neurales locales font partie de la licence Engramm. Sans elle, chaque carte porte un badge ambre Licence Engramm, et Télécharger reste cliquable pour que le clic puisse expliquer pourquoi (Les voix neurales locales nécessitent une licence Engramm.) au lieu de ne rien faire.
Sur chaque carte :
- Télécharger installe le moteur. Le bouton compte Téléchargement 42 % · torch avec l'étape en cours, parce qu'une installation de plusieurs gigaoctets dont le pourcentage ne bouge pas se lit comme un gel. Un × rouge l'arrête ; une installation arrêtée n'est pas une erreur. Tant que l'app demande encore si un moteur est sur le disque, la carte dit Vérification… plutôt que de deviner.
- Utiliser fait d'un moteur installé celui qui lit à voix haute. Cliquer une carte non installée dit Télécharge d'abord Piper, puis sélectionne-le.
- Charger / Décharger (tous les moteurs sauf Piper) mettent le modèle en mémoire maintenant, pour que la première phrase ne paie pas le démarrage à froid (Le charger maintenant pour que la première phrase soit instantanée.), ou le retirent pour libérer la mémoire graphique (Libère sa VRAM. La phrase suivante le rechargera.).
- Une liste de voix et Tester la voix. Pour Piper, + Plus de voix (français, anglais, 40+ langues) ouvre la Bibliothèque de voix : recherche, filtre de langue, filtre de qualité, un bouton Utiliser par voix. Le bouton ↻ voix récupère les nouveaux fichiers de voix.
- Vitesse : Piper va de plus lent à plus rapide (0,5× à 2×). Chatterbox ne fait que ralentir (0,5× à 1×, l'extrémité droite dit naturel) : son moteur ignore tout ce qui est plus rapide, donc le curseur ne le propose pas. XTTS n'a aucun réglage de vitesse.
- Expressivité (Chatterbox) : de plus neutre à plus animée. La note en dessous compte : Cuite dans la voix clonée : la changer reprépare le clone une fois, la phrase suivante sera donc plus lente.
- Sur un moteur qui clone, Cloner ma voix enregistre depuis le micro jusqu'à ce que vous cliquiez de nouveau (plafond 60 s, le bouton compte 23s / 60s · clique pour arrêter) et Depuis un fichier utilise un enregistrement que vous avez déjà. La ligne en dessous dit ce qui est sur le disque, avec sa durée et sa date (Voix enregistrée · 23s · …), ou Aucune voix enregistrée pour l'instant. Un seul enregistrement sert à tous les moteurs qui clonent, et 15–60 s de voix propre clonent le mieux. Une fois que vous avez un échantillon, la ligne d'état vous prévient quand le moteur sélectionné ne sait pas s'en servir : ce moteur n'utilise pas ta voix clonée. Choisis-en un qui le fait.
Quand deux moteurs sont installés, un encadré sous les cartes sépare les surfaces :
- Moteur pour la conversation ∞ : Une conversation ne peut pas attendre un moteur lent ; la lecture, si. Par défaut Comme la lecture.
- Moteur pour la lecture longue (MnemoReader) : Un livre peut attendre un moteur plus lent — personne ne vous répond. Prenez celui qui sonne le mieux.
Séparer les surfaces garde deux modèles chargés en même temps. Sur une carte qui ne peut pas tenir les deux, chaque phrase prend plusieurs fois plus de temps, et CUDA ne le signale pas. La page le dit avant les sélecteurs, et affiche un encadré rouge (Deux moteurs vocaux sont chargés en même temps…) chaque fois que ça arrive vraiment. Déchargez celui que vous n'utilisez pas.
Volume de lecture
Un curseur de 0 à 100 %, par pas de 5. Volume quand Mnemosyne OS lit les réponses à voix haute (bouton haut-parleur sur les messages). Les boutons Tester la voix plus haut jouent à cette valeur, donc ce que vous entendez est ce que le chat utilisera.
Assistant vocal (logo ∞)
Trois interrupteurs pour la conversation ∞ :
- Interrompre en parlant (barge-in) : Casque audio requis. Parle pendant qu'il répond et il s'arrête pour t'écouter. Sur haut-parleurs il s'entend et se coupe.
- Yeux expressifs : L'orbe a des yeux qui clignent et réagissent à son état (écoute, réflexion, parole). Désactivé = ∞ pur.
- Générer les réponses en local (économise les tokens cloud) : L'assistant ∞ écrit ses réponses avec SON propre petit modèle local (Qwen 1.5B, à télécharger ci-dessous) — ton IA principale (cloud) n'est pas touchée. L'activer révèle une ligne pour ce modèle, Qwen 2.5 1.5B · ~1 GB · le cerveau dédié de l'assistant, avec son propre bouton Télécharger.
Apparence de l'orbe
Une vignette en direct de l'orbe actuelle et le nom de son préréglage, et un bouton Personnaliser qui ouvre le Studio de l'orbe :
- Taille en plein écran, un curseur, et un interrupteur Plein écran (L'orbe remplit tout l'écran en mode assistant — le réglage de taille ne s'applique plus.).
- Préréglages Visage : Minimal, Doux, Mascotte, Kawaii.
- Orbes abstraites : Aurore, Nébuleuse, Plasma, Halo, Constellation. Une tuile dit Plus de visages via MnemoHub — bientôt.
- Réglages fins pour la famille visage : Yeux (Pétillants, Ronds, Points), Volume 3D, Sourcils, Joues rosées. Touchez l'un d'eux et le préréglage s'appelle Perso.
Prononciation et corrections d'écoute
Deux tables modifiables, chacune une liste de lignes mot → remplacement avec Ajouter un mot / Ajouter une correction et un × pour retirer :
- Prononciation (mot → prononcé) réécrit les mots avant qu'une voix les dise. Corrige comment certains mots sont dits (noms, acronymes). Ex. Mnemosyne → Némozine.
- Corrections d'écoute (mal entendu → correct) réécrit chaque transcription. Corrige les mots que la transcription rate toujours. Ex. Némozine → Mnemosyne.
Elles s'appliquent à tous les moteurs, locaux ou cloud.
La ligne du bas
Les modèles locaux tournent 100 % hors-ligne. Le cloud utilise ta clé OpenAI/Gemini (l'audio quitte la machine). C'est tout le modèle de confidentialité de la page en une phrase : les paliers locaux n'envoient rien ; la transcription cloud envoie votre audio, et ElevenLabs reçoit le texte qu'il lit.