HoldToType

dokumentacja

Wybierz model mowy do swojego języka

Kreator wybiera rozsądny, a zmienić go można w każdej chwili w Języki i modele. Co ten wybór naprawdę rozstrzyga:

Jeśli chceszWeźDlaczego
bezpieczny wybór dla każdego języka

Whisper Medium q5

Obejmuje wszystko i tłumaczy sam — na angielski porządnie, na pozostałe języki interfejsu eksperymentalnie. Około 1,5 GB.

najmniejsze opóźnienie

wąski model pod twój język

GigaAM v3 zamienił 11-sekundowe zdanie w tekst w 0,47 s wobec 11,6 s u Whispera, przy jednej trzeciej pamięci.

tekst w trakcie mówienia

strumieniowy Nemotron 3.5

Fragmenty tekstu pojawiają się na pasku kilka razy na sekundę, 40 języków.

słabą maszynę

Whisper Base albo Moonshine

Małe i szybkie; mniej dokładne przy długich zdaniach.

Katalog pokazuje, ile pamięci model zajmie naprawdę, w odniesieniu do tego, ile jest wolnej w tej chwili, i wprost mówi, czy potrafi tłumaczyć.

Co oferuje katalog

Modele pobiera się na żądanie, z repozytoriów poniżej, a każdy plik porównuje się z opublikowanym SHA-256 przed użyciem. Żaden nie jest dołączony do programu.

ModelDo czego
Whisper Base, Small, Medium, Turbo

Domyślny wybór dla każdego języka i modele, na których stoi tłumaczenie: na angielski własnym zadaniem tłumaczenia, na pozostałe języki przez powiedzenie im, że mowa jest już w języku docelowym. Wersje kwantyzowane oznaczone są q5.

GigaAM v3

Model jednojęzyczny, który sam stawia znaki interpunkcyjne. Na zdaniu 11-sekundowym zajęło mu to 0,47 s wobec 11,6 s u Whisper Medium, przy 277 MB pamięci wobec 814 MB.

GigaAM v2

Poprzednie pokolenie tego samego modelu: ta sama szybkość, bez interpunkcji.

Parakeet TDT 0.6B v3

25 języków europejskich w jednym wąskim modelu, interpunkcję stawia sam.

Nemotron 3.5 Streaming

Pisze w trakcie mówienia: fragmenty tekstu na pasku, 40 języków, z interpunkcją.

Canary 180M Flash

Angielski, niemiecki, hiszpański i francuski — i tłumaczy między nimi bez Whispera.

Qwen3 ASR

Około 30 języków, najcięższy i najdokładniejszy w katalogu.

Moonshine

Mały i szybki, na jeden język naraz i na skromny sprzęt.

Dowolny model redaktora GGUF

Obróbka uruchamia dowolny model GGUF, który jej wskażesz; wyszukiwanie i pobieranie z Hugging Face jest w programie.

Twoje własne modele

Katalog to nie płot. Wrzuć plik modelu Whisper (ggml-*.bin) albo folder modelu sherpa-onnx do folderu models obok programu, a pojawi się na liście pod własną nazwą, oznaczony jako znaleziony lokalnie. To samo z redaktorem: obróbka końcowa uruchamia dowolny plik GGUF, który wskażesz, a wyszukiwarka w programie pobiera go z Hugging Face.

Jak działa tłumaczenie

Whisper tłumaczy na angielski własnym zadaniem translate, a na pozostałe języki interfejsu, gdy powie mu się, że mowa jest już w języku docelowym. Canary sam tłumaczy między angielskim, niemieckim, hiszpańskim i francuskim. Wąskie modele tylko spisują: gdy jeden z nich obsługuje twój język, program trzyma w gotowości najlepszego zainstalowanego Whispera, a plakietka proponuje przekazać mu frazę.

Gdzie ustawia się model każdego języka i jak działają wiersze, opisano w przewodniku Języki i modele.