Ajustes → Voz
Todo lo que Mnemosyne OS hace con el sonido se ajusta aquí: cómo te oye (micrófono y transcripción), cómo habla (la voz de lectura) y cómo se comporta el asistente de voz ∞. La entrada del carril se llama Voz; el subtítulo de la página dice Entrada de voz (dictado) y voz de respuesta (lectura, incl. ElevenLabs).
Cada control de esta página se guarda en cuanto lo tocas. No hay botón Guardar.
Para lo que la voz hace una vez configurada, mira Calliope, la voz. Esta página trata de los ajustes.
Micrófono
La primera causa de una transcripción absurda (una respuesta reducida a « you ») es un micrófono mudo, así que la página abre con un medidor en vivo.
- Un selector lista Micrófono predeterminado del sistema y cada entrada que conoce el sistema. Los nombres de los dispositivos aparecen una vez concedido el permiso del micrófono.
- Probar micrófono arranca el medidor; el botón pasa a Detener prueba. Mientras corre, la página dice Habla ahora — la barra debería moverse. La barra queda gris por debajo de un susurro, ámbar a nivel bajo, verde cuando la señal es buena, e indica el Pico alcanzado.
- No se detecta señal — ¿dispositivo de entrada incorrecto o micro silenciado? significa que el pico nunca salió de cero: cambia de dispositivo en el selector, o reactiva el micro.
- Acceso al micrófono denegado. Permítelo en Windows → Privacidad → Micrófono. es un rechazo del sistema, no de la app.
Nada se graba durante la prueba. Es un medidor de nivel y nada más.
Motor por defecto (transcripción)
Dos tarjetas eligen cómo tu voz se convierte en texto:
- Local (Whisper): Sin conexión, privado. Requiere un modelo descargado. Bajo la tarjeta, una línea nombra el Modelo activo y dice si está listo para usar o no descargado — abre Avanzado para obtenerlo.
- Nube: Listo · openai (o gemini) cuando tu proveedor de IA activo sabe transcribir; si no, Requiere una clave OpenAI/Gemini. Con la tarjeta seleccionada, una línea dice Transcripción mediante tu modelo configurado: OpenAI whisper-1 (o Gemini). Si tu modelo en la nube activo no transcribe audio, la línea pasa a ámbar: Tu modelo en la nube activo no transcribe audio. Configura OpenAI o Gemini en IA y Modelos.
Si eliges Nube pero ninguna clave sabe transcribir, se usa igualmente un modelo local descargado. La elección aquí es una preferencia, nunca una forma de perder el dictado.
Avanzado — gestionar modelos
Plegado por defecto; se abre solo durante una descarga para que el progreso siga visible. Dos niveles:
Modelos locales (Whisper), que corren dentro de la app:
| Modelo | Tamaño | La nota de la app |
|---|---|---|
| Whisper Tiny | ~75 MB | El más rápido y ligero — menor precisión. Multilingüe. |
| Whisper Base | ~150 MB | Equilibrio velocidad/precisión. Multilingüe. |
| Whisper Small | ~250 MB | Buena precisión, velocidad razonable. Multilingüe. |
| Distil-Whisper (EN) | ~180 MB | Rápido y preciso, solo inglés. |
Modelos grandes (motor de voz GPU), que corren en un proceso aparte:
| Modelo | Tamaño | La nota de la app |
|---|---|---|
| Whisper Medium | ~1.5 GB | Alta precisión, multilingüe. |
| Whisper Large v3 Turbo ★ | ~1.6 GB | Precisión cercana a large-v3, mucho más rápido. Recomendado. |
| Whisper Large v3 | ~3 GB | Precisión máxima, multilingüe. El modelo más pesado. |
Haz clic en una fila para convertirla en el modelo activo; Descargar lo obtiene. Para un modelo grande, el primer Descargar instala antes el motor de voz GPU (el botón dice Instalando 40 %, luego Descargando 40 %). La línea de estado sobre el nivel describe la máquina en la que estás:
- Descargar un modelo abajo instala el motor GPU automáticamente la primera vez (una sola vez, requiere Python 3.10+). La aceleración GPU requiere una tarjeta gráfica NVIDIA (CUDA) — las demás máquinas transcriben en la CPU.
- Motor de voz GPU instalado · CUDA una vez que corre en la tarjeta.
- GPU NVIDIA detectada — activa la aceleración para una transcripción mucho más rápida. con un botón Activar GPU, cuando la tarjeta está pero aún no las bibliotecas CUDA (unos 800 MB, descargados una vez).
- No se detectó GPU CUDA: los modelos grandes se ejecutarán en la CPU (más lento). en cualquier otra máquina. Los modelos grandes funcionan igual, solo más despacio.
Un modelo descargado muestra Descargado y una papelera. La papelera pregunta ¿Eliminar? y ofrece Eliminar / Cancelar antes de quitar nada.
Salida de voz (lectura)
Tres tarjetas eligen la voz que lee las respuestas en voz alta, en el chat, en la conversación ∞ y en MnemoReader:
- Sistema (sin conexión): Privado, gratis, robótico. Las voces integradas en tu sistema, nada que descargar.
- Neural local: Natural, gratis, offline. Descargable. Motores que corren en tu máquina, descritos más abajo.
- ElevenLabs (nube): Voz natural. Requiere una clave; el texto sale del equipo.
ElevenLabs: introducir tu clave API
- Crear una clave en ElevenLabs
En tu cuenta de ElevenLabs, abre la página de claves API (está bajo el menú de tu perfil) y crea una clave. Cópiala en el acto: ElevenLabs solo la muestra una vez. Si restringes lo que la clave puede hacer, necesita la síntesis de voz y la lectura de tus voces.
- Seleccionar la tarjeta ElevenLabs (nube)
Abre Ajustes → Voz, baja hasta Salida de voz (lectura) y haz clic en ElevenLabs (nube). Bajo las tarjetas aparece un campo Clave API de ElevenLabs.
- Pegar la clave
Pégala en el campo. Es un campo de contraseña, los caracteres quedan ocultos, y se guarda mientras escribes. No hay ningún botón Guardar que pulsar.
- Cargar voces
Haz clic en Cargar voces. El botón queda gris mientras el campo esté vacío. Las voces de tu cuenta aparecen en un desplegable al lado, con la primera ya seleccionada. Si la clave es incorrecta, el error que devuelve ElevenLabs se imprime en rojo bajo el campo.
- Probar voz
Con una voz seleccionada, Probar voz pronuncia una frase completa en el idioma de tu interfaz, al volumen de lectura ajustado más abajo en la página.
- Elegir el modelo
Dos botones eligen el modelo de ElevenLabs: Calidad (Voz más rica · 1 crédito/car.) o Eco + rápido (~½ del coste · menos latencia). Esos créditos son créditos de ElevenLabs, facturados por ElevenLabs.
La clave se queda en tu máquina, en los ajustes de la app, y solo se envía a ElevenLabs, con cada petición. La tarjeta lo dice sin rodeos: con este motor, el texto de cada respuesta leída en voz alta sale de tu equipo.
Neural local
Con Neural local seleccionado, una línea dice qué motor habla (Leyendo con: Piper), y luego una tarjeta por motor:
| Motor | Tamaño | La nota de la app |
|---|---|---|
| Piper | ~290 MB | Francés, español e inglés naturales · sin conexión |
| XTTS-v2 (voice cloning) | ~5 GB | Clona tu voz · FR/ES/EN · GPU · necesita Python |
| Chatterbox | ~4,5 GB | Expresivo · 23 idiomas · clona tu voz · GPU · necesita Python |
| Zonos-v0.1 | ~5,5 GB | Vector de emoción · FR/ES/EN/DE/ZH/JA · 6 GB de VRAM · necesita Python |
Zonos aparece en gris y marcado Pronto: está aparcado, no se puede instalar.
Las voces neuronales locales forman parte de la licencia Engramm. Sin ella, cada tarjeta lleva una insignia ámbar Licencia Engramm, y Descargar sigue siendo clicable para que el clic pueda explicar por qué (Las voces neuronales locales requieren una licencia Engramm.) en vez de no hacer nada.
En cada tarjeta:
- Descargar instala el motor. El botón cuenta Descargando 42 % · torch con la etapa en curso, porque una instalación de varios gigabytes cuyo porcentaje no se mueve se lee como un bloqueo. Una × roja la detiene; una instalación detenida no es un error. Mientras la app aún pregunta si un motor está en disco, la tarjeta dice Comprobando… en lugar de adivinar.
- Usar convierte un motor instalado en el que lee en voz alta. Hacer clic en una tarjeta no instalada dice Descarga primero Piper y luego selecciónalo.
- Cargar / Descargar (todos los motores salvo Piper) ponen el modelo en memoria ahora, para que la primera frase no pague el arranque en frío (Cárgalo ahora para que la primera frase sea instantánea.), o lo quitan para liberar la memoria gráfica (Libera su VRAM. La siguiente frase lo recargará.). Ojo: en esa píldora, Descargar significa quitar de la memoria, no obtener el motor.
- Un desplegable de voces y Probar voz. Para Piper, + Más voces (francés, inglés, más de 40 idiomas) abre la Biblioteca de voces: búsqueda, filtro de idioma, filtro de calidad, un botón Usar por voz. El botón ↻ voces obtiene los nuevos archivos de voz.
- Velocidad: Piper va de más lento a más rápido (0,5× a 2×). Chatterbox solo ralentiza (0,5× a 1×, el extremo derecho dice natural): su motor ignora todo lo que sea más rápido, así que el control no lo ofrece. XTTS no tiene ajuste de velocidad.
- Expresividad (Chatterbox): de más neutra a más animada. La nota de debajo importa: Está integrada en la voz clonada: cambiarla vuelve a preparar el clon una vez, así que la frase siguiente tardará más.
- En un motor que clona, Clonar mi voz graba desde el micrófono hasta que vuelves a tocar (tope de 60 s, el botón cuenta 23s / 60s · toca para detener) y Desde un archivo usa una grabación que ya tienes. La línea de debajo dice lo que hay en disco, con su duración y fecha (Voz guardada · 23s · …), o Aún no hay ninguna voz grabada. Una sola grabación sirve para todos los motores que clonan, y 15–60 s de voz limpia clonan mejor. Cuando ya tienes una muestra, la línea de estado te avisa si el motor seleccionado no sabe usarla: este motor no usa tu voz clonada. Elige uno que sí lo haga.
Cuando hay dos motores instalados, un recuadro bajo las tarjetas separa las superficies:
- Motor para la conversación ∞: Una conversación no puede esperar a un motor lento; la lectura sí. Por defecto Igual que la lectura.
- Motor para la lectura larga (MnemoReader): Un libro puede esperar a un motor más lento: nadie te está respondiendo. Elige el que mejor suene.
Separar las superficies mantiene dos modelos cargados a la vez. En una tarjeta que no puede con ambos, cada frase tarda varias veces más, y CUDA no lo avisa. La página lo dice antes de los selectores y muestra un recuadro rojo (Hay dos motores de voz cargados a la vez…) cada vez que ocurre de verdad. Quita de memoria el que no uses.
Volumen de lectura
Un control deslizante de 0 a 100 %, en pasos de 5. Volumen cuando Mnemosyne lee las respuestas en voz alta (botón de altavoz en los mensajes). Los botones Probar voz de arriba suenan a este valor, así que lo que oyes es lo que usará el chat.
Asistente de voz (logo ∞)
Tres interruptores para la conversación ∞:
- Interrumpir hablando (barge-in): Auriculares obligatorios. Habla mientras responde y se detiene para escucharte. Con altavoces se oye a sí mismo y se corta.
- Ojos expresivos: El orbe tiene ojos que parpadean y reaccionan a su estado (escucha, piensa, habla). Desactivado = ∞ puro.
- Generar respuestas en local (ahorra tokens cloud): El asistente ∞ escribe sus respuestas con SU propio modelo local pequeño (Qwen 1.5B, descargable abajo) — tu IA principal (cloud) no se toca. Activarlo revela una fila para ese modelo, Qwen 2.5 1.5B · ~1 GB · el cerebro propio del asistente, con su propio botón Descargar.
Apariencia del orbe
Una miniatura en vivo del orbe actual y el nombre de su preajuste, y un botón Personalizar que abre el Estudio del orbe:
- Tamaño en pantalla completa, un control deslizante, y un interruptor Pantalla completa (El orbe llena toda la pantalla en modo asistente — el ajuste de tamaño ya no se aplica.).
- Preajustes Cara: Mínimo, Suave, Mascota, Kawaii.
- Orbes abstractos: Aurora, Nebulosa, Plasma, Halo, Constelación. Una tarjeta dice Más caras vía MnemoHub — pronto.
- Ajustes finos para la familia cara: Ojos (Brillantes, Redondos, Puntos), Volumen 3D, Cejas, Mejillas sonrojadas. Toca cualquiera y el preajuste pasa a llamarse Personal.
Pronunciación y correcciones de escucha
Dos tablas editables, cada una una lista de filas palabra → sustitución con Añadir palabra / Añadir una corrección y una × para quitar:
- Pronunciación (palabra → hablado) reescribe las palabras antes de que cualquier voz las diga. Corrige cómo se dicen ciertas palabras (nombres, siglas). Ej. Mnemosyne → Némozine.
- Correcciones de escucha (mal oído → correcto) reescribe cada transcripción. Corrige palabras que la transcripción siempre falla. Ej. Némozine → Mnemosyne.
Se aplican a todos los motores, locales o en la nube.
La línea de abajo
Los modelos locales funcionan sin conexión. La nube usa tu clave OpenAI/Gemini (el audio sale del equipo). Es todo el modelo de privacidad de la página en una frase: los niveles locales no envían nada; la transcripción en la nube envía tu audio, y ElevenLabs recibe el texto que lee.