FunFluenで学ぶ

字幕と音声が違うときのシャドーイング|聞き間違いと字幕の省略を分ける

字幕と音声が違うときは、まず字幕を隠してaudioを確認。聞き間違い・connected speech・字幕の省略/condensing・meaning conflictを分け、shadowingで何を真似するか判断します。

短い答え

shadowingで発音・rhythmのmodelにするのはaudioです。subtitleは意味や綴りを助けるsupporting textで、必ずしもverbatim transcriptとは限りません。

字幕にあるwordが聞こえないからといって、あなたの耳が必ず間違っているわけではありません。逆に字幕が短いからといって、必ずsubtitle errorでもありません。shadowingで真似する相手は字幕ではなくspeakerです。

Audio first, subtitle second

mismatchが出たら、まず字幕を隠してaudioだけ聞きます。そのあと字幕を戻し、次のどれかに分類します。

字幕とaudioのmismatchを3つに分ける
Category何が起きている?次にすること
Audio Extraaudioにfiller・repetition・detailがあるが字幕は短いomission/condensation候補として、actual audioをshadow
Audio Compressed字幕のwordsは合っているが、reduction/linkingで違って聞こえるconnected speechを聞き直す
Meaning Conflictcontent wordsやmeaningがmaterially違うneighboring cue・timing・track・versionを確認し、無理に一致させない

まだ分からないなら、Still Unclearで止めて構いません。分からないものを字幕どおりに“聞こえたこと”にしないのが大事です。

subtitleは「絶対にそのままのscript」とは限らない

subtitle typeによって、audioとの距離は変わります。たとえばNetflixのU.S. English SDH guidelineは、audioへできるだけ忠実にする一方、reading speedやsynchronicityのためにtruncation、text reduction、deletion、condensingを認めています。

NetflixのJapanese SDH guidelineも、original contentをできるだけ残しながら、reading speedのためのreduction・deletion・condensingを認めています。つまりsame-language SDHでも、必ず100% verbatimとは限りません。

さらにNetflixのsubtitle-template guidelineでは、templateはverbatimである必要がなく、deletion、reformulation、re-timing、re-segmentation、mergingなどが使われる場合があります。

DCMP Captioning Keyも、captionはmeaningやessential vocabularyを保ちながら、presentation rateのためにeditingされる場合があるとしています。

だから「字幕と違う = 自分の耳がwrong」という式は成立しません。同時に「字幕と違う = subtitleがwrong」でもありません。

Hide → Hear → Reveal:text authorityをいったん外す

  1. 字幕を隠す。
  2. 短いlineを2回聞く。
  3. 自信を持って聞こえたwordsだけ書くか、口で再現する。
  4. 字幕を表示する。
  5. differenceをAudio Extra / Audio Compressed / Meaning Conflictへ分類する。

字幕を見た瞬間、急にそのwordが“聞こえる気”になることがあります。便利ですが、その超能力に全部を任せない。先にaudio-only evidenceを作ります。

Audio Extra:audioにはある。でも字幕は短い

Original practice example

Well, I was actually going to call you, but I got stuck at work.

たとえばdisplayed subtitleが I was going to call you, but I got stuck at work. までなら、audioの Wellactually が本当に聞こえるかをaudio-onlyで確認します。聞こえるならAudio Extra / subtitle condensation候補です。

電話できなかった理由を説明する場面。

意味:ええと、実は電話しようと思っていたんだけど、仕事で動けなくなって。

exact natural-shadowingなら、confirmedした Wellactually も含めてspeakerをshadowしてください。

FunFluen 日本語.

Audio Compressed:字幕は合っている。でも音がつぶれて聞こえる

もう一つはsubtitle omissionではなく、connected speechです。2025年のconnected-speech perception studyでは、contractionsやelisionsのようなphonological variationがL2 learnersのperceptionへchallengeを作ることが扱われています。

Original practice example

I should've told you earlier.

subtitleもexactly I should've told you earlier. なのに should've が一語のようにcompressedして聞こえるなら、subtitle omissionではなくAudio Compressed候補です。

もっと早く伝えるべきだった、と謝る場面。

意味:もっと早く言うべきだった。

model → text → modelで聞き、綴りどおりに一語ずつ離れて聞こえない箇所を一つだけ探してください。

repetitionやfillerが字幕で整理されることもある

Original practice example

I, I don't know. Maybe we should wait.

illustrative subtitleが I don't know. Maybe we should wait. なら、最初のrepeated I が実際に聞こえるか確認します。clearly audibleなら、字幕側がspoken repetitionを整理した可能性があります。

迷いながら待つことを提案する場面。

意味:わ、分からない。待った方がいいかもしれない。

natural-speech shadowingならspeakerのrepetitionも真似し、clean production drillに切り替える時だけ後で整理してください。

Meaning Conflict:content wordまで違うなら、無理に一致させない

Original practice example

I'll call you after lunch.

もしaudioが明確に after lunch なのに、displayed subtitleが tonight とmaterially違うtime meaningを示すなら、normal condensationとは扱いません。まず前後のsubtitle cueが少し早く/遅く表示されていないか確認し、そのうえでdifferent audio/subtitle track、version、errorなどを疑います。

あとで電話すると約束する場面。

意味:昼食の後に電話するね。

neighboring cueとactive audio/subtitle trackを確認し、原因が分からなければsubtitle wordingをpronunciation modelにしないでください。

ここで「きっと自分がtonightをlunchと聞き間違えた」と決める必要も、「字幕が絶対wrong」と決める必要もありません。Unresolvedはvalidな結果です。

same-language subtitleとtranslated subtitleは同じ証拠ではない

subtitle typeごとの使い方
Text typeshadowingでの扱い
same-language SDH/captionaudioへ比較的近いことが多いが、reading speed/syncでeditingされる場合がある
subtitle templateverbatimとは限らず、translationのbaseとしてedited wordingを含む場合がある
translated subtitlemeaning理解には使えるが、source-language pronunciation transcriptとしては扱わない

特にtranslated subtitleは「何と言ったか」ではなく「何を意味したか」を別languageで伝えるjobがあります。source-language shadowingなら、pronunciation modelはactual audioです。

Audio-First Mismatch Triage

分類した後はどうする?
  • Audio Extra:confirmed audioをshadow。subtitle omissionをpractice noteとして扱う。
  • Audio Compressed:subtitleを消さず、connected speechの聞こえ方をrepair。
  • Meaning Conflict:neighboring timing・track・version・caption issueを確認。無理に一つへ合わせない。
  • Still Unclear:confirmed部分だけshadowし、unverified wordingは保留。

結局、何をshadowする?

pronunciation、rhythm、timingを練習するshadowingなら、actual speaker audioをmodelにします。subtitleは聞こえたwordの綴り、meaning、underlying words、verified differenceの確認に使います。

ただし、聞き取れていないformを推測で書き足し、その推測をshadowするのは避けます。

聞こえ方の問題とlanguage formの問題は分ける

I should've told you more early. は、ordinary comparative timingの意味ではunusual/non-idiomaticです。自然なのは I should've told you earlier.

聞き手は「もっと早く言うべきだった」という意図を理解しやすいですが、これはsubtitle/audio mismatchではなくlanguage formの問題です。early 自体は I arrived early. のように普通に使えます。

I don't know. Maybe we should wait.I'm not sure. Maybe we should wait. はどちらも文法的で、後者はcontextによって少しsoft/less categoricalに聞こえることがあります。

10秒のSubtitle-Off Test

  1. 字幕をoff。
  2. 10秒以内の短い区間を聞く。
  3. 聞こえたものだけ書くか、口で再現する。
  4. 字幕をon。
  5. differenceを一つだけcircleする。

目的は全部dictationすることではありません。「字幕を見たから聞こえた」のか、「audioだけでも聞けた」のかを分けることです。

Audio first, subtitle second

字幕と音声が違った時、最初から耳か字幕のどちらかを犯人にしない。字幕を隠す。聞く。字幕を戻す。Audio Extra、Audio Compressed、Meaning Conflictへ分ける。

shadowingで真似するのはspeakerです。subtitleは助けになる。でも、speakerよりsubtitleをshadowしない。それだけ覚えておけば、mismatchでかなり迷いにくくなります。

参考にしたガイドライン・研究