Brancher ton propre serveur de modèle
Mnemosyne peut appeler un serveur de modèle qui t'appartient plutôt qu'un fournisseur. N'importe quel serveur compatible avec l'API OpenAI convient : vLLM, Ollama, TGI, ou une passerelle interne. La carte s'appelle « Votre propre serveur », dans les réglages Intelligence.
Les deux champs qui comptent
L'URL de base est l'adresse de ton serveur. Elle vient de toi et de nulle part ailleurs.
Il faut le schéma : http://hôte:port ou https://hôte:port. Sur un réseau privé, http://
convient très bien et n'est pas refusé. Une adresse sans schéma est rejetée plutôt que
devinée, parce que deviner ferait appeler la mauvaise machine en silence.
Le nom du modèle est du texte libre. C'est le nom exact auquel ton serveur répond, et il n'est ni traduit, ni complété, ni remplacé par un défaut. Il n'y a pas de liste à choisir : personne d'autre que toi ne sait ce que ton serveur héberge.
La clé API est facultative. Beaucoup de serveurs internes n'en demandent aucune, et quand tu n'en donnes pas, aucun en-tête d'autorisation n'est envoyé.
Vérifier avant de compter dessus
La carte affiche l'adresse réellement appelée, calculée par la même fonction que les
réponses. Tu vois donc si le /v1 que tu as ajouté, ou omis, produit bien l'appel que tu
crois.
Le bouton « Vérifier » interroge la liste des modèles sur cette même adresse et te dit ce qu'il a trouvé. Un serveur qui répond mais n'expose pas de catalogue n'est pas déclaré en échec : c'est une passerelle qui ne publie pas sa liste, pas une panne.
Ce que cette route ne fait pas
Elle ne traite pas les images. Une pièce jointe visuelle est refusée en amont plutôt qu'envoyée à un serveur dont personne ne sait s'il sait la lire.
Elle n'affiche pas de coût. Mnemosyne ne connaît pas la facture de ta propre machine, donc elle n'invente pas un chiffre et n'affiche pas non plus « gratuit ».