Whisper vs. Parakeet: echte Benchmark-Zahlen
Die meisten Engine-Vergleiche im Web zitieren unbelegte Zahlen. Diese Seite zeigt genau, wie jede Zahl entstanden ist, und liefert das Skript mit, das sie erzeugt hat — beide Engines nebeneinander, auf derselben Maschine, unter denselben Bedingungen gemessen.
WhisPaste holen, kostenlos und Open SourceMethodik
Die Tabelle unten zeigt, wie schnell und wie genau jede Engine tatsächlich ist — gemessen unter identischen Bedingungen auf derselben Maschine, ohne Marketing-Rundung. Real-Time-Faktor (RTF) ist Verarbeitungszeit geteilt durch Audiolänge — niedriger ist schneller, 1,0× bedeutet exakt Echtzeit. Word Error Rate (WER) ist die übliche Wortebene-Editierdistanz (Ersetzungen + Löschungen + Einfügungen) geteilt durch die Wortzahl der Referenz, mikro-gemittelt über jede Probe im Testset (Editierungen und Referenzwörter werden zuerst summiert, nicht die WER pro Probe gemittelt — das würde kurze Sätze übergewichten). Das Testset umfasst 20 Sprachproben (rund 94 Sekunden gesamt) aus LibriSpeech dev-clean (CC BY 4.0, Panayotov et al. 2015) — vorgelesene, gemeinfreie Hörbuch-Passagen mit bekanntem Referenz-Transkript. Das ist weiterhin eine kleine Probe mit sauberer Sprachqualität — reales Audio mit Akzenten, Hintergrundgeräuschen oder schnellem Sprechen schneidet schlechter ab. Jede Zeile hier ist eine Untergrenze, keine Garantie. whisper.cpp steht bewusst zweimal in der Tabelle: einmal mit aktiviertem GPU-Backend (Metal), einmal mit explizit deaktivierter GPU (-ng/--no-gpu) — so ist die CPU-Zeile ein fairer Vergleich auf derselben Hardware-Basis gegen Parakeet, das überhaupt kein GPU-Backend hat.
| Hardware-Klasse | Engine | Modell | Geschwindigkeit | Genauigkeit | |
|---|---|---|---|---|---|
| Apple Silicon (Metal) | whisper.cpp | small (Compact) | 9× schneller als Echtzeit RTF 0.1173× | 96.6% der Wörter korrekt WER 3.4 % | Gemessen |
| Apple Silicon (CPU) | whisper.cpp | small (Compact) | 3× schneller als Echtzeit RTF 0.3068× | 96.6% der Wörter korrekt WER 3.4 % | Gemessen |
| Apple Silicon (CPU) | Parakeet (sherpa-onnx) | parakeet-tdt-0.6b-v3 | 35× schneller als Echtzeit RTF 0.0288× | 98.1% der Wörter korrekt WER 1.9 % | Gemessen |
Der Unterschied auf einen Blick
Beide Engines nur auf der CPU, dieselbe Maschine — die faire Basis, kein GPU-Vorteil auf einer Seite.
Wie diese Zahlen gemessen wurden
Diese Zahlen stammen von einer Apple-Silicon-Maschine, jede Engine einmal unter denselben Bedingungen gemessen. Andere Hardware — andere Chips, Temperaturdrosselung, Hintergrundlast — liefert andere Zahlen. Die Skripte unten zeigen genau, was gemessen wurde und wie, falls du die Details nachvollziehen willst.
Das whisper.cpp-Benchmark-Skript auf GitHub ansehen · Das Parakeet-Benchmark-Skript auf GitHub ansehen