Benchmark run

Tiny base triage

Triage of Tiny and Base model families (all quantization and language variants) to evaluate whether these smaller models are worth further benchmarking.

May 9, 2026

Models
12
Samples per dataset
50
Warmup runs
3
Hardware
Apple M4 Max / 36 GB / macOS 26.4.1

Full results

Accuracy is the share of words transcribed correctly per language condition, so higher is better; speed is milliseconds per second of audio, so lower is better. The best value in each column is emphasised, and a cell reading a dash says on hover why there is no figure in it.

Accuracy (%) per language, and speed in ms per second of audio, so lower is better. A cell reading a dash was never measured, and hovering any cell says what is behind it.

Whisper Base47142 MB334 MB57 ms70.4%Every word from every language counted together, not an average of per-language scores.91.1%Every word from every language counted together, not an average of per-language scores.58.8%Every word from every language counted together, not an average of per-language scores.91.8%90.6%88.4%39.5%35.3%
Whisper Base Q8_04778 MB247 MB57 ms70.3%Every word from every language counted together, not an average of per-language scores.91.0%Every word from every language counted together, not an average of per-language scores.58.6%Every word from every language counted together, not an average of per-language scores.92.4%90.1%88.6%38.4%35.5%
Whisper Base Q5_14757 MB219 MB57 ms70.1%Every word from every language counted together, not an average of per-language scores.90.2%Every word from every language counted together, not an average of per-language scores.58.8%Every word from every language counted together, not an average of per-language scores.90.8%89.9%88.9%37.6%36.4%
Whisper Tiny4775 MB224 MB57 ms59.9%Every word from every language counted together, not an average of per-language scores.86.9%Every word from every language counted together, not an average of per-language scores.44.7%Every word from every language counted together, not an average of per-language scores.87.6%86.4%85.0%14.2%16.9%
Whisper Tiny Q8_04742 MB174 MB57 ms59.6%Every word from every language counted together, not an average of per-language scores.86.9%Every word from every language counted together, not an average of per-language scores.44.1%Every word from every language counted together, not an average of per-language scores.87.2%86.8%85.0%11.2%17.9%
Whisper Tiny Q5_14731 MB157 MB58 ms58.4%Every word from every language counted together, not an average of per-language scores.86.4%Every word from every language counted together, not an average of per-language scores.42.6%Every word from every language counted together, not an average of per-language scores.87.1%86.0%83.5%14.4%11.7%
Whisper Base Q5_1 en4757 MB217 MB58 ms30.7%Every word from every language counted together, not an average of per-language scores.92.3%Every word from every language counted together, not an average of per-language scores.-4.2%Every word from every language counted together, not an average of per-language scores.92.7%92.1%3.8%-9.6%-10.2%
Whisper Base Q8_0 en4778 MB247 MB58 ms30.6%Every word from every language counted together, not an average of per-language scores.92.0%Every word from every language counted together, not an average of per-language scores.-4.2%Every word from every language counted together, not an average of per-language scores.92.4%91.8%3.2%-7.9%-10.9%
Whisper Base en47142 MB333 MB59 ms29.7%Every word from every language counted together, not an average of per-language scores.92.3%Every word from every language counted together, not an average of per-language scores.-5.7%Every word from every language counted together, not an average of per-language scores.93.1%91.8%0.8%-7.0%-13.8%
Whisper Tiny en4775 MB224 MB59 ms23.5%Every word from every language counted together, not an average of per-language scores.88.2%Every word from every language counted together, not an average of per-language scores.-13.1%Every word from every language counted together, not an average of per-language scores.88.9%87.8%-1.2%-18.7%-24.4%
Whisper Tiny Q5_1 en4731 MB157 MB59 ms22.4%Every word from every language counted together, not an average of per-language scores.88.0%Every word from every language counted together, not an average of per-language scores.-14.7%Every word from every language counted together, not an average of per-language scores.88.8%87.5%-1.0%-26.0%-23.2%
Whisper Tiny Q8_0 en4742 MB173 MB58 ms21.8%Every word from every language counted together, not an average of per-language scores.88.5%Every word from every language counted together, not an average of per-language scores.-15.9%Every word from every language counted together, not an average of per-language scores.89.1%88.1%-2.3%-20.7%-30.7%

At a glance

Ratings computed from benchmark data, scaled 1 to 10, and written with their scale in every cell. Accuracy is based on Word Error Rate (WER) and does not include punctuation yet.

Ratings run 1 to 10, higher is better. A cell reading a dash was never measured, and hovering any cell says what is behind it.

Whisper BaseAll languagesYes9/105/10Every word from every language counted together, not an average of per-language scores.
Whisper Base Q5_1All languagesYes9/105/10Every word from every language counted together, not an average of per-language scores.
Whisper Base Q8_0All languagesYes9/105/10Every word from every language counted together, not an average of per-language scores.
Whisper TinyAll languagesYes9/103/10Every word from every language counted together, not an average of per-language scores.
Whisper Tiny Q5_1All languagesYes9/103/10Every word from every language counted together, not an average of per-language scores.
Whisper Tiny Q8_0All languagesYes9/103/10Every word from every language counted together, not an average of per-language scores.
Whisper Base enEnglish onlyNo8/101/10Every word from every language counted together, not an average of per-language scores.
Whisper Base Q5_1 enEnglish onlyNo9/101/10Every word from every language counted together, not an average of per-language scores.
Whisper Base Q8_0 enEnglish onlyNo9/101/10Every word from every language counted together, not an average of per-language scores.
Whisper Tiny enEnglish onlyNo8/101/10Every word from every language counted together, not an average of per-language scores.
Whisper Tiny Q5_1 enEnglish onlyNo8/101/10Every word from every language counted together, not an average of per-language scores.
Whisper Tiny Q8_0 enEnglish onlyNo8/101/10Every word from every language counted together, not an average of per-language scores.

Charts

The plots generated alongside this run. Select a chart to open it full size.

Bar chart comparing model accuracy across English, Spanish, Danish, and Hungarian benchmark conditions.
Accuracy by model and test condition
Bar chart comparing transcription speed across models and test conditions.
Speed comparison across conditions
Bar chart showing average English, multilingual, and overall accuracy per model.
Average accuracy by language group