Zum Inhalt
Anmelden

/docs · VoiceLab · Intro

Warum die Füllwortdichte wichtiger ist als die Füllwortanzahl

"Ähs" zu zählen ist die falsche Messgröße. Die Dichte verrät, ob sie ein Problem sind.


Jedes Podcast-QA-Tool will deine Füllwörter zählen. Die meisten hören damit auf. Füllwörter als rohe Zahl zu zählen ist größtenteils Rauschen: Ein 5-minütiges Interview und eine 90-minütige Diskussion ergeben völlig unterschiedliche Summen, doch das Erlebnis beim Zuhören hängt von etwas ganz anderem ab.

Dieses Etwas ist die Dichte: Füllwörter pro Minute tatsächlicher Sprache.

Die Messung

filler_density = filler_count / speech_seconds * 60

Beachte den Divisor: nicht die Gesamtdauer der Datei, sondern Sprachsekunden. Ein Podcast mit fünf Sekunden langen Füllwortschüben, gefolgt von Stille, ist etwas anderes als einer, bei dem jede Sekunde dicht von Zögern durchsetzt ist.

Die Schwellenwerte, die wir in VoiceLab verwenden:

DichteHörerlebnis
< 3 /minFlüssig, professionell
3–6 /minGesprächig, in Ordnung für Talkshows
6–10 /minAuffällig, eventuell Schnitt nötig
> 10 /minStörend, gründlicher Schnittdurchgang nötig

Das sind Richtwerte, keine Gesetze. Ein energiegeladener Improvisations-Podcast mit 12 Füllwörtern/Min kann brillant sein. Eine gescriptete Erklärung mit 5 Füllwörtern/Min ist kaputt.

Warum die Anzahl allein in die Irre führt

Nimm zwei Podcasts:

  • Podcast A: 60 Minuten, 40 Füllwörter. Gesamt: 40 Füllwörter.
  • Podcast B: 10 Minuten, 30 Füllwörter. Gesamt: 30 Füllwörter.

Nach Anzahl ist Podcast A „schlechter“. Nach Dichte liegt Podcast A bei 0,67/Min und Podcast B bei 3/Min. Letzteres ist eine ehrlichere Zusammenfassung dessen, was ein Hörer empfinden wird.

Auch die Pausenlänge zählt

Eine Pause von 200 ms ist meist unsichtbar. Eine Pause von 600 ms ist dramatisch. Eine Pause von 1500 ms ist ein Zögern, das oft ein Füllwort ersetzt. VoiceLab erfasst die Pausenverteilung neben der Füllwortdichte, denn ein Füllwort durch ein langes Zögern zu ersetzen ist eigentlich keine Verbesserung, es ist dasselbe Problem in anderer Gestalt.

Wie VoiceLab Füllwörter ohne ASR erkennt

Ohne Speech-to-Text ist exaktes Füllwortzählen nicht möglich. Aber es gibt brauchbare Näherungen:

  • Subsyllabische Energieschübe: kurze Hüllkurvenspitzen, eingerahmt von Stille, die kürzer als ein typisches Wort, aber länger als ein Klick ist. Diese korrelieren stark mit „ähm“, „äh“, „halt“, „weißt du“.
  • Pausencluster-Dichte: Bereiche, in denen sich 80–400-ms-Pausen mehr als 4× pro 10 Sekunden häufen. Das erfasst den Sprechrhythmus, der für füllwortlastigen Vortrag typisch ist, selbst wenn einzelne Füllwörter nicht erkannt werden.

Die Ebene auf Signalniveau ist gut genug für QA. Für exakte Zählungen und Arbeit auf Wortebene brauchst du nachgelagert ASR (Whisper, Deepgram, AWS Transcribe).

Was du mit der Zahl anfängst

Wenn deine Dichte über 6/Min liegt und du die Sendung schneidest, drei Taktiken von praktizierenden Editoren:

  1. Schneiden, nicht ersetzen. Leerer Raum zwischen Sätzen klingt in 80 % der Fälle besser als ein Füllwort.
  2. Straffe, bevor du Füllwörter schneidest. Die meiste „Füllwort“-Wahrnehmung ist in Wirklichkeit Tempo. Das Straffen des gesamten Vortrags lässt Füllwörter in den Hintergrund treten.
  3. Lass die bewussten stehen. Ein „weißt du, was ich meine?“ mit Charakter schlägt ein steriles Skript. Schneide die Persönlichkeit nicht heraus.

Verwandt