Offline-Spracherkennung: wenn die Aufnahme den Rechner nicht verlassen darf.
Wenn du Spracherkennung (Speech-to-Text) auf deinem Laptop willst, die Aufnahme aber das Gerät nicht verlassen darf (wegen eines Kundenvertrags, einer regulierten Branche oder schlicht aus persönlicher Präferenz), fährt WhisPaste die gesamte Transkriptions-Pipeline lokal mit whisper.cpp. Das Audio wird dort verarbeitet, wo es aufgenommen wurde, und nichts wird hochgeladen.
WhisPaste holen, kostenlos und Open SourceWhisPaste ist ein kostenloses, quelloffenes Offline-Spracherkennungs-Tool für Windows, macOS und Linux. Es führt Whisper-Modelle vollständig auf dem eigenen Rechner aus — dein Audio verlässt nie den Computer, und du brauchst weder Internet noch Konto.
Modus-Wahl: lokal als Default, Cloud auf Abruf
WhisPaste startet im lokalen Modus. Das Modell läuft auf deiner CPU oder GPU, das Audio bleibt auf dem Rechner, und das Transkript wird ohne Netzwerk-Round-Trip an den Cursor geliefert. Wenn du für eine lange Aufnahme maximale Geschwindigkeit brauchst, kannst du in den Einstellungen einen Cloud-Anbieter wählen, das ist aber eine explizite Entscheidung pro Sitzung, kein versteckter Fallback.
Was Offline kann und nicht kann
WhisPaste bringt zwei Offline-Engines mit. Offline-Whisper kommt mit 99 Sprachen, gemischtsprachigen Eingaben, Akzenten, Hintergrundgeräuschen und natürlicher Sprache mit Pausen und Neuansätzen klar. Die zweite Engine, Parakeet, tauscht diese Sprachbreite gegen CPU-Tempo (rund 25 Sprachen, mehrfach schneller, ganz ohne GPU). Was keine der beiden kann: Echtzeit-Streaming an einen Server, Sprecher-Diarisierung über viele Kanäle oder Modellgrößen, die deinen verfügbaren RAM überschreiten. WhisPaste veranschlagt für das kompakte Modell rund 900 MB GPU-VRAM, für das ausgewogene rund 1,5 GB und für das Premium-Modell rund 2,6 GB.
RAM- und CPU-Profil
Das Minimum sind 8 GB RAM und eine 64-Bit-CPU unter Windows 10, macOS 11 Big Sur (Apple Silicon) oder Ubuntu Linux, genug für das kompakte Modell auf der CPU. Mit 16 GB RAM und einer GPU mit 2–4 GB VRAM transkribiert das ausgewogene Modell einen Ein-Minuten-Clip in Sekunden. Apple Silicon teilt sich den Speicher zwischen CPU und GPU, weshalb ein 8-GB-Mac schon das ausgewogene Modell trägt.
- Welche Modellgröße soll ich für Offline-Speech-to-Text wählen?
- Starte mit dem kompakten Modell: es deckt Alltags-Speech-to-Text auf einer 8-GB-Maschine ohne GPU ab. Wenn du 16 GB RAM und eine dedizierte GPU hast, liefert das ausgewogene Modell merklich sauberere Transkripte bei fünffacher Geschwindigkeit. WhisPaste bietet genau drei Größen an; die Premium-Größe lohnt sich erst, wenn du rund 3 GB oder mehr freies VRAM hast und längere Aufnahmen verarbeitest.
- Funktioniert der Offline-Modus wirklich ganz ohne Internet?
- Ja. Nach dem einmaligen Modell-Download läuft whisper.cpp vollständig auf deinem Rechner. Flugmodus, eine Air-gapped Workstation oder ein wackeliger Hotspot beeinflussen die Transkriptionsqualität gar nicht: das einzige, was Netz braucht, ist der optionale Auto-Update-Check, den du deaktivieren kannst.
- Wie genau ist Offline-Speech-to-Text im Vergleich zu Cloud-APIs?
- Für alltägliche Spracheingabe ziehen die Offline-Modelle „ausgewogen" und „Premium" mit dem gleich, was die meisten Cloud-APIs produzieren. Spezialdomänen (starke Akzente, sehr laute Umgebungen, seltenes Fachvokabular) profitieren manchmal von einem größeren Cloud-Modell. WhisPaste lässt dich pro Sitzung umschalten, sodass du Offline als Standard fährst und Cloud nur dann holst, wenn eine Aufnahme es wirklich braucht.