FunFluenで学ぶ

シャドーイングの音源と自分の声を別々に録音して比べる方法

シャドーイングのmodel音源と自分の声を別trackにして、recording latencyを学習者のlagと混同せず比べる方法を解説。rough align後にEntry・Stress・Boundary・Endingの4 landmarksをA/Bで確認します。

短い答え

modelをReference Track、自分の声をVoice Trackに分けます。ただし、raw waveformのズレをそのまま「自分のlag」と判断してはいけません。recording latencyを考慮し、rough alignしてから同じspeech landmarksを耳で比べます。

別trackにしたら波形がズレて見える。そこで「自分はこの分だけ遅い」と決めるのは早すぎます。device/software側のdelayかもしれません。波形は地図、判定ではありません。

まず全体像:Two-Track Landmark Compare

  1. Reference Trackにmodel音源を用意する。
  2. headphonesでmodelを聞きながら、Voice Trackへ自分だけ録音する。
  3. technical latencyがあり得る前提でrough alignする。
  4. model only → self only → model only の順でA/Bする。
  5. Entry / Stress / Boundary / Endingを一つずつ比べる。
  6. 違いを一つだけ持ち帰る。

同時再生は最後の確認用。最初から二本を重ねて聞くと、また「どっちの音?」に戻りやすくなります。

Track Aはmodel、Track Bはself

使えるreference fileを持っているなら、音源側をわざわざ再録音する必要はありません。許可されたmodel audioをReference Trackとしてimportし、その音をheadphonesで聞きながら自分のmicだけ別trackへ録音します。

Audacityのofficial recording FAQでも、existing trackを再生しながら新しいtrackを録音するoverdub workflowが案内され、microphone recordingではheadphonesを使って既存trackの音がmicへ入りにくくする方法が説明されています。Audacityは一例で、同じことができる別のmultitrack recorderでも構いません。

二本の役割
Track入れるもの比較時の役割
Reference Trackmodel audio基準のtiming・stress・phrasing
Voice Track自分のmic音声自分の実際のproduction

modelがVoice Trackへ大量に漏れないようにする

speakerからmodelを流し、そのすぐ横でmic録音すると、Voice Trackにもmodelがかなり入ることがあります。それでは別trackにした意味が薄くなります。

基本はheadphonesやearphonesでreferenceを聞き、micには自分の声が主に入る状態を作ります。完全なstudio separationは必要ありません。「self trackをsoloにした時、自分の声を普通に聞き取れる」程度で十分です。

一番大事:trackのズレを、そのまま自分の遅れだと思わない

Audacityのofficial troubleshootingでは、existing trackを聞きながらnew trackを録音するoverdubでrecording latencyが生じ、recorded trackがout of syncになることがあると説明されています。softwareが補正しても、追加調整が必要な場合があります。

だから、timeline上でVoice Trackが100ms、200ms、あるいはそれ以上右に見えても、その数字をそのまま「自分のshadowing lag」にしません。

absolute lagを測りたい時は?

device/softwareのlatency compensationをきちんとcalibrateしたsetupが必要です。このページではそこまでのmeasurementはしません。calibrationが不明なら、absolute millisecondsではなく、rough align後のrelative rhythm・stress・boundary・endingを比べます。

Rough Align:ぴったりではなく、同じmomentを見つけられればいい

目的は二本のwaveformを美しく重ねることではありません。modelとselfで「同じphrase」をすぐ切り替えて聞けるようにすることです。

  1. clearなstressed wordかphraseを一つ選ぶ。
  2. 二本のtrackでその位置を見つける。
  3. 必要ならtrackを大まかにずらし、同じphraseをA/Bしやすくする。
  4. absolute lagはcalibrationなしで判定しない。

波形テトリスを始めなくて大丈夫です。roughで十分。

Landmark 1:Entry — sentenceの入り

Entryは、latency未calibratedならqualitative comparisonです。「いつもphraseの入りが不安定」「modelより毎回かなり後から入るように聞こえる」といったpatternは見られますが、rough-aligned timelineから正確なmillisecondsを読みません。

Original practice example

We're supposed to meet outside the station.

Reference TrackとVoice Trackをrough alignした後、sentence entryが安定しているか聞きます。ただしtechnical latencyが未calibratedなら、timelineのabsolute gapを“あなたのlag”とは判定しません。

待ち合わせ場所を確認する場面。

意味:駅の外で会うことになっています。

model → self → modelの順で聞き、入りが毎回不安定かだけ確認してください。

FunFluen 日本語.

Landmark 2:Stress — どのwordが目立つ?

Original practice example

Could you send me the final version by Friday?

modelで final versionFriday がどうprominentに聞こえるかをsoloで確認し、次にselfだけを聞きます。waveformの高さだけでstressを決めず、耳で比較します。

仕事で締切付きの依頼をする場面。

意味:金曜日までに最終版を送ってもらえますか?

一番差が分かるprominent wordを一つだけmarkしてください。

Landmark 3:Boundary — chunkのつなぎ

Original practice example

The meeting was moved because two people couldn't come.

The meeting was movedbecause... のtransitionを比べます。selfだけhard pauseが長い、またはreason clauseへのentryが急になる、といったdifferenceを耳で探します。

日程変更の理由を説明する場面。

意味:2人が来られないので、会議は変更された。

boundaryの“間”だけでなく、前後のpitch/rhythmの流れも聞いてください。

Landmark 4:Ending — 最後までphraseが残る?

Original practice example

I would've called you if I'd known.

final chunk if I'd known をmodel/selfでsolo A/Bします。endingが短く消える、I'd が抜ける、最後だけ急ぐ、などを一つ観察します。whole-waveform similarityは見ません。

過去の仮定を説明する場面。

意味:知っていたら電話したのに。

endingで一番はっきり聞こえるdifferenceを一つだけ言葉にしてください。

Four-Landmark Compare

これはFunFluenの実践frameworkです。waveform analysisの代わりに、learnerが聞き分けやすいspeech landmarksへcomparisonを絞ります。

waveformは違うのに、耳では差が分からない時は?

見た目だけでproblemを作らないでください。waveformはvolume、mic distance、room noise、recording chainなどでも形が変わります。learner-facing comparisonでは、耳で意味のあるdifferenceが取れなければ“今回は判断しない”で構いません。

最初はSolo A/B。Overlayは最後

二本を同時再生すると、一致している時は気持ちいいですが、違う時はまた音が混ざります。最初は次の順で十分です。

  1. Reference Trackだけ。
  2. Voice Trackだけ。
  3. Reference Trackをもう一度。
  4. 必要なら最後にoverlay。

overlayがmuddyならMute Test。片方をmuteしてA/Bへ戻ります。

Audacityを使うなら:これは一例

AudacityのRecording Preferencesには、existing tracksを再生しながらnew trackを録音するoverdub機能があります。またrecording troubleshootingではlatency correctionとmanual adjustmentの必要性が説明されています。

ただし、このページの方法はAudacity専用ではありません。必要なのは「modelをreferenceとして保持できる」「selfを別track/別録音にできる」「A/Bできる」の三つです。

trackが綺麗でも、language formの違いは別に見る

The meeting was moved because two people couldn't came. は、意図した意味では標準英語で誤りです。modal couldn't の後はbase formなので、自然なのは The meeting was moved because two people couldn't come.

聞き手は意味を推測しやすいですが、これはrecording alignmentのproblemではありません。came 自体は Two people came yesterday. のようなsimple pastでは正しく使えます。

Could you send me the final version by Friday?Please send me the final version by Friday. はどちらも文法的で、後者の方がdirectです。

modelとlearnerを比べること自体は珍しい方法ではない

Hashimoto, Gomi & Shiraishiの2022年研究では、日本人英語学習者のproductionをAmerican English model stimuliとの関係でacoustically analysisしています。またshadowing self-monitoring studyでもlearnerが自分のshadowed voiceを聞くconditionが扱われています。

ただし、research-grade acoustic measurementとlearnerの日常practiceは別物です。ここではwaveformを採点器にせず、聞き比べを楽にするための地図として使います。

Reference audioは、使ってよいものを使う

手元に利用可能なmodel audio fileがあるなら、それをReference Trackとして使うのが最も簡単です。このページはstreaming serviceなどから音源を抜き出す方法を扱いません。recordingや再利用が許されている教材・自作音源・手元のpractice fileで行ってください。

波形は地図、判定ではない

modelとselfを分ける。technical latencyを考える。rough alignする。model → self → modelで聞く。そしてEntry、Stress、Boundary、Endingを一つずつ比べる。

目的は二本の波形を完全一致させることではありません。同じspeech momentを、混ざらず公平に聞けるようにすることです。

参考にした資料