docs
L'assistant en choisit un raisonnable, et il se change à tout moment dans Langues et modèles. Ce que ce choix décide vraiment :
Whisper Medium q5
Couvre tout et traduit lui-même — vers l'anglais correctement, vers les autres langues de l'interface de façon expérimentale. Environ 1,5 Go.
un modèle étroit pour votre langue
GigaAM v3 a transformé une phrase de 11 secondes en texte en 0,47 s contre 11,6 s pour Whisper, avec un tiers de la mémoire.
Nemotron 3.5 en flux
Le texte partiel apparaît sur le bandeau plusieurs fois par seconde, 40 langues.
Whisper Base ou Moonshine
Petits et rapides ; moins précis sur les phrases longues.
Le catalogue montre la mémoire que chaque modèle prendra réellement, mesurée contre ce qui est libre à cet instant, et dit franchement s'il sait traduire.
Les modèles se téléchargent à la demande, depuis les dépôts ci-dessous, et chaque fichier est comparé à un SHA-256 publié avant d'être utilisé. Aucun n'est fourni avec le programme.
Le choix par défaut pour toute langue, et les modèles qui portent la traduction : vers l'anglais par leur propre tâche de traduction, vers les autres langues en leur disant que la parole est déjà dans la langue visée. Les versions quantifiées portent la marque q5.
Un modèle monolingue qui ponctue tout seul. Sur une phrase de 11 secondes il a pris 0,47 s contre 11,6 s pour Whisper Medium, et 277 Mo de mémoire contre 814 Mo.
La génération précédente du même modèle : la même vitesse, sans la ponctuation.
25 langues européennes dans un seul modèle étroit, ponctue tout seul.
Écrit pendant que vous parlez : texte partiel sur le bandeau, 40 langues, ponctuation comprise.
Anglais, allemand, espagnol et français, et il traduit entre eux sans Whisper.
Une trentaine de langues, le plus lourd et le plus précis du catalogue.
Petit et rapide, pour une langue à la fois sur une machine modeste.
Le post-traitement fait tourner n'importe quel modèle GGUF que vous lui indiquez, cherché et téléchargé depuis Hugging Face dans le programme.
Le catalogue n'est pas une clôture. Déposez un fichier de modèle Whisper (ggml-*.bin) ou un dossier de modèle sherpa-onnx dans le dossier models à côté du programme, et il apparaît dans la liste sous son propre nom, marqué comme trouvé en local. Idem pour l'éditeur : le post-traitement exécute tout fichier GGUF que vous lui indiquez, et la recherche dans le programme en récupère un depuis Hugging Face.
Whisper traduit vers l'anglais avec sa propre tâche de traduction, et vers les autres langues de l'interface en lui disant que la parole est déjà dans la langue cible. Canary traduit lui-même entre l'anglais, l'allemand, l'espagnol et le français. Les modèles spécialisés ne font que transcrire : quand l'un d'eux sert votre langue, le programme garde le meilleur Whisper installé en réserve, et la plaque propose de lui passer une phrase.
Où se règle le modèle de chaque langue et comment fonctionnent les lignes, c'est dans le guide Langues et modèles.