HoldToType

docs

Choisir un modèle de reconnaissance pour votre langue

L'assistant en choisit un raisonnable, et il se change à tout moment dans Langues et modèles. Ce que ce choix décide vraiment :

Si vous voulezPrenezPourquoi
un choix sûr pour n'importe quelle langue

Whisper Medium q5

Couvre tout et traduit lui-même — vers l'anglais correctement, vers les autres langues de l'interface de façon expérimentale. Environ 1,5 Go.

la latence la plus faible

un modèle étroit pour votre langue

GigaAM v3 a transformé une phrase de 11 secondes en texte en 0,47 s contre 11,6 s pour Whisper, avec un tiers de la mémoire.

du texte pendant que vous parlez

Nemotron 3.5 en flux

Le texte partiel apparaît sur le bandeau plusieurs fois par seconde, 40 langues.

une machine modeste

Whisper Base ou Moonshine

Petits et rapides ; moins précis sur les phrases longues.

Le catalogue montre la mémoire que chaque modèle prendra réellement, mesurée contre ce qui est libre à cet instant, et dit franchement s'il sait traduire.

Ce que propose le catalogue

Les modèles se téléchargent à la demande, depuis les dépôts ci-dessous, et chaque fichier est comparé à un SHA-256 publié avant d'être utilisé. Aucun n'est fourni avec le programme.

ModèleÀ quoi il sert
Whisper Base, Small, Medium, Turbo

Le choix par défaut pour toute langue, et les modèles qui portent la traduction : vers l'anglais par leur propre tâche de traduction, vers les autres langues en leur disant que la parole est déjà dans la langue visée. Les versions quantifiées portent la marque q5.

GigaAM v3

Un modèle monolingue qui ponctue tout seul. Sur une phrase de 11 secondes il a pris 0,47 s contre 11,6 s pour Whisper Medium, et 277 Mo de mémoire contre 814 Mo.

GigaAM v2

La génération précédente du même modèle : la même vitesse, sans la ponctuation.

Parakeet TDT 0.6B v3

25 langues européennes dans un seul modèle étroit, ponctue tout seul.

Nemotron 3.5 Streaming

Écrit pendant que vous parlez : texte partiel sur le bandeau, 40 langues, ponctuation comprise.

Canary 180M Flash

Anglais, allemand, espagnol et français, et il traduit entre eux sans Whisper.

Qwen3 ASR

Une trentaine de langues, le plus lourd et le plus précis du catalogue.

Moonshine

Petit et rapide, pour une langue à la fois sur une machine modeste.

Tout modèle éditeur GGUF

Le post-traitement fait tourner n'importe quel modèle GGUF que vous lui indiquez, cherché et téléchargé depuis Hugging Face dans le programme.

Vos propres modèles

Le catalogue n'est pas une clôture. Déposez un fichier de modèle Whisper (ggml-*.bin) ou un dossier de modèle sherpa-onnx dans le dossier models à côté du programme, et il apparaît dans la liste sous son propre nom, marqué comme trouvé en local. Idem pour l'éditeur : le post-traitement exécute tout fichier GGUF que vous lui indiquez, et la recherche dans le programme en récupère un depuis Hugging Face.

Comment marche la traduction

Whisper traduit vers l'anglais avec sa propre tâche de traduction, et vers les autres langues de l'interface en lui disant que la parole est déjà dans la langue cible. Canary traduit lui-même entre l'anglais, l'allemand, l'espagnol et le français. Les modèles spécialisés ne font que transcrire : quand l'un d'eux sert votre langue, le programme garde le meilleur Whisper installé en réserve, et la plaque propose de lui passer une phrase.

Où se règle le modèle de chaque langue et comment fonctionnent les lignes, c'est dans le guide Langues et modèles.