Vergleich
Die Programme, mit denen man uns am häufigsten vergleicht, in einer Tabelle. Ehrlich, auch da, wo wir verlieren. Preise und Funktionen sind das, was jeder Hersteller veröffentlicht.
| HoldToType | Handy | Wispr Flow | Dragon | Whisper Flow | DictaFlow | Typeless | |
|---|---|---|---|---|---|---|---|
| Signierte Builds | Noch nicht | Ja | Ja | Ja | Ja | Ja | Ja |
| Preis | Kostenlos | Kostenlos | 12 $ / Monat | 699 $ einmalig | Ab 9 $ / Monat | 7 $ / Monat | 12 $ / Monat |
| Abo oder Credits | Keine | Keine | Abo | Einmallizenz | Credits | Abo | Abo |
| Konto | Keins | Keins | Nötig | Nötig | Nötig | Nötig | Nötig |
| Audio verlässt den Rechner | Nein | Nein | Ja | Nein | Ja | Ja | Ja |
| Läuft offline | Ja | Ja | Nein | Ja | Nein | Bezahloption | Nein |
| Open Source | MIT | MIT | Nein | Nein | Nein | Nein | Nein |
| Sprachen | 99 | 99 | 100+ | 7 | 100+ | 90+ | 100+ |
| Live-Text beim Sprechen | Ja | Nein | Nein | Ja | Nein | Nein | Ja |
| Übersetzung | 7 Sprachen | Nein | Nein | Nein | Nein | Nein | Ja |
| Bearbeitung durch ein lokales Modell | Ja | Nein | Cloud | Nein | Cloud | Cloud | Cloud |
| Wahl des Sprachmodells | 9 Modelle, eines pro Sprache | Whisper-Größen und Parakeet | Nein, nur ihres | Nein, nur ihres | Nein, nur ihres | Nein, nur ihres | Nein, nur ihres |
| Eigene Sprachmodelle | Jede Whisper-GGML-Datei oder jedes sherpa-onnx-Modell im Ordner models | — | Nein | Nein | Nein | Nein | Nein |
| Modelle mit Text beim Sprechen | Nemotron 3.5 | Nein | Nein | Eigene Engine | Nein | Nein | Eigene Engine |
| Nachbearbeitung durch ein Modell | Ja | Nein | Ja | Nein | Ja | Ja | Ja |
| Wo die Nachbearbeitung läuft | Auf Ihrer Platte oder einem Server Ihrer Wahl | — | Deren Cloud | — | Deren Cloud | Deren Cloud | Deren Cloud |
| Wahl des Editor-Modells | Jedes GGUF von Hugging Face oder jede API | Nein | Nein | Nein | Nein | Nein | Nein |
| Eigene Prompts | Ja, Ketten, jede mit Tastenkürzel | Nein | Eingebaute Stile | Nein | — | — | Eingebaute Korrekturen |
| Erkennungsserver auf einem anderen Rechner | Ja | Nein | Nein | Nein | Nein | Nein | Nein |
| Selbst definierte Sprachbefehle | Ja | Nein | Nur eingebaute | Ja | — | — | Nur eingebaute |
| Wo der Diktatverlauf liegt | Auf Ihrer Platte, standardmäßig aus | Auf Ihrer Platte | Deren Server | — | Deren Server | Deren Server | Deren Server, Option auf dem Gerät |
| Sprachen der Oberfläche | 8 | — | Englisch | Mehrere | — | — | — |
| Eigener Wortschatz | Ja | Nein | Ja | Ja | Ja | Ja | Ja |
| Portabler Ordner | Ja | Nein | Nein | Nein | Nein | Nein | Nein |
Preise und Funktionen, wie von jedem Hersteller im September 2026 veröffentlicht. Ein Strich heißt, der Hersteller sagt es nicht.
Kein Mac und kein Telefon. Die Builds sind noch nicht signiert, also warnt Windows einmal. Es gibt keinen Cloud-Abgleich zwischen Ihren Rechnern: Einstellungen und Verlauf liegen im Ordner, und Sie kopieren sie selbst.
Die Genauigkeit bei Alltagssprache liegt überall nah beieinander: unter den meisten dieser Programme stecken dieselben offenen Modelle. Eigener Wortschatz ist verbreitet. Die Bezahlprogramme liefern ein poliertes Onboarding, das ein Ein-Personen-Projekt nicht bieten kann.
Nichts zu zahlen und nirgends anzumelden. Das Audio verlässt den Rechner nie. Der Quellcode ist offen unter MIT. Ein Modell pro Sprache, Live-Text beim Sprechen, Übersetzung in sieben Sprachen, ein Editor-Modell, das auf Ihrer Platte läuft, und ein portabler Ordner für den Stick.
Die Windows-Spracheingabe, das eingebaute Werkzeug hinter Win+H, ist kostenlos und braucht keine Installation, schickt aber für die meisten Sprachen das Audio an Microsoft und hat kein Wörterbuch für Ihre eigenen Wörter. Reine Mac-Programme wie VoiceInk, FluidVoice oder HoldType, das mit dem ähnlichen Namen, bleiben draußen, weil HoldToType für Windows ist. Vibe und andere Dateitranskribierer machen eine andere Arbeit: sie transkribieren Aufnahmen, nicht das, was Sie am Cursor sagen.