Drei Wege stehen zur Wahl: Sie sprechen selbst, Sie lassen den Text von einer Computerstimme sprechen, oder Sie verzichten auf Sprache und arbeiten nur mit Musik und Texteinblendungen. Alle drei funktionieren — vorausgesetzt, die Kerninformationen stehen zusätzlich als Text im Bild.
Selbst sprechen ist die stärkste Variante, weil Menschen Menschen folgen. Sie brauchen dafür keinen Aufwand: ein ruhiger Raum, das Telefon in Armlänge, der Text vorher einmal laut gelesen. Sprechen Sie langsamer, als es sich anfühlt, und machen Sie am Satzende eine kurze Pause — das ist der häufigste Unterschied zwischen laienhaft und professionell.
Eine Computerstimme ist die praktikable Lösung für Serien. Sie klingt inzwischen unauffällig, ist in jeder Sprache verfügbar und erlaubt es, den Text zu ändern, ohne neu aufzunehmen. Für wiederkehrende Objektvideos ist das der realistische Weg; für Beiträge, in denen Sie als Person auftreten, nicht.
Ganz ohne Sprache reicht oft aus, wenn das Video kurz ist. Musik, ruhige Schnitte, große Texteinblendungen mit Ort, Fläche, Zimmern und Preis — das ist stumm verständlich und funktioniert genau deshalb. Untertitel gehören in jedem Fall dazu, auch wenn gesprochen wird.