マニュアルのメニュー

目的 03

動画・音声ファイルの字幕作成・文字起こし

収録済みファイルを音声認識し、修正して必要な形式で保存します。

この手順で得られる結果

元動画・音声と時間が合った文字起こしを作り、テキスト、CSV、SRT、SBVへ書き出せます。

Mojidasで動画ファイルの文字起こしを編集する画面。動画プレビューと発話バー付きの音声波形、その下に編集用のテキスト欄を表示しています。

画像内の「Enterで2秒戻して再生」は旧表記です。現在は、文字を修正した後のEnterで修正位置の1秒前から再生します(発話の先頭より前には戻りません)。

ファイルの音声認識にはログインが必要です。 音声認識開始時に、指定した有効範囲の時間(未指定ならファイル全体)を上限として予約します。正常に完了すると、実際に音声認識された発話時間だけを消費し、無音区間など使用しなかった分は残り時間へ戻ります。

途中で手動停止した場合は、予約した有効範囲分を消費します。 開始前の確認画面で、予約する時間と現在の残り時間を確認してください。

トリミングで認識する範囲を指定する

トリミングハンドルは初期状態では非表示です。波形エリア右下の有効範囲表示の横にあるトリミングアイコンで、左右の黄色ハンドルと上下の黄色線を切り替えられます。範囲外のグレーはハンドルを隠しても表示されます。指定した開始・終了時刻は保持され、音声認識はその範囲を対象にします。

  1. 右下のトリミングアイコンを押す

    波形に黄色い左右のハンドルと上下の線が表示されます。

  2. 両端のハンドルをドラッグする

    左ハンドルの内側(右端)が開始時刻、右ハンドルの内側(左端)が終了時刻です。右下の範囲表示で指定時刻を確認します。

  3. 再生して範囲を確認する

    開始より左と終了より右がグレーになります。不要な前後を認識対象から外せますが、グレー部分の波形も残り、クリックして再生できます。

  4. 必要に応じてハンドルを隠す

    同じアイコンをもう一度押します。ハンドルを隠しても指定範囲は解除されず、範囲外のグレー表示も残ります。

ファイルの元セッションでは、波形にある開始・終了マーカーをドラッグして、音声認識の「有効範囲」を指定できます。マーカーは元ファイル上の固定時刻を示し、拡大・縮小・スクロールしても指定時刻は変わりません。画面外にあるマーカーは表示されず、その時刻までスクロールすると再び表示されます。開始より左・終了より右は薄いグレーで表示しますが、範囲外もクリックして再生できます。全範囲にするには両端をファイルの先頭・末尾へ戻します。認識中は変更できません。範囲変更直後やファイル末尾からの再開は、指定した範囲の先頭から再生します。

元ファイルと保存音声は変更せず、認識済みの発話も自動削除しません。表示時刻と字幕時刻は元ファイルの先頭基準を維持します。再認識する場合は、既存の結果を削除する確認が表示されます。

再生ゲイン(音量)を調整する

波形右側の音量スライダーで、再生音量を0〜400%に調整できます。標準は100%です。音量表示部分をダブルクリックすると100%へ戻せます。小さい録音は少しずつ増幅し、再生して聞きやすさを確認してください。

ファイルセッションでは閲覧・編集のどちらでも調整できます。リアルタイムセッションの編集時にも、録音済み音声の再生音量を調整できます。リアルタイム認識用の入力レベルとは別の設定です。

ファイル認識には、認識開始時の再生ゲインが適用されます。 開始前にトリミング範囲と音量を確認してください。後から音量を変えても、すでにある認識結果は変わりません。元ファイルや保存音声そのものは書き換えません。

0%は無音です。増幅で上限を超えた音はクリッピング処理で制限しますが、歪むことがあります。音割れした元音声を修復する機能ではありません。

認識完了後の時間を確認する

認識結果の保存と利用時間の確定が成功すると、そのセッションの画面上部に完了通知が表示されます。

動画・音声の長さ
取り込んだファイル全体の長さです。
認識対象の長さ
トリミングした場合に表示される、今回の認識対象の長さです。開始前に予約する時間の基準になります。
実際に認識で使用した時間(発話時間)
今回の認識で利用時間として確定した発話時間です。アップロードや認識処理が終わるまで待った時間ではありません。無音で認識結果がなければ0になります。

時間は「時:分:秒.ミリ秒」で表示します。通知は右側の×で閉じられます。別のセッションを表示中に完了した場合は、処理したセッションへ戻ると確認できます。アプリを終了すると通知は消えます。キャンセルや失敗の場合は、この完了通知は表示されません。

ファイルから結果を作る手順

  1. アカウントを作成またはログインする

    起動時に表示されるアカウント作成・ログイン画面で、無料アカウントを作成するか、既存のアカウントでログインします。

    アカウントの詳細 →
  2. 「新しいセッション」を押す

    セッション名を入力し、種類で「動画・音声」を選びます。

  3. 「動画・音声ファイルを選択」を押す

    文字起こししたいファイルを1つ選び、「作成」を押します。Mojidasが内部再生用の音声と波形を準備します。

  4. 準備完了まで待つ

    「音声と波形を準備中」が消え、動画または音声のプレビューと波形が表示されるまで待ちます。別セッションへ移動しても処理は続きます。

    ファイルを準備できないとき →
  5. トリミングと再生ゲインを調整する

    必要なら前後の不要部分を認識対象から外し、再生して音量を確認します。

    トリミングの手順 →
  6. 「文字起こしを開始」を押す

    認識言語、使用する辞書、有効範囲の長さ(未指定ならファイル全体)をもとに予約する認識時間、現在の残り時間を確認します。正常完了後の実際の消費は、音声認識された発話時間だけです。音声で主に話されている言語を選んでください。

  7. 確認画面で「開始」を押す

    ボタンを押した時点の最新の残り時間でもう一度確認し、有効範囲分を予約してから、アップロード、処理待ち、音声認識、結果受信の順に進みます。予約できる時間が足りない場合は開始されません。元の動画ファイルそのものは送信せず、パソコン内で準備した認識用音声だけを音声認識処理へ送ります。

  8. 音声認識完了まで待つ

    長いファイルは、取り込み時に保存された音声の区間(目安15分、最大20分)ごとに音声認識します。全体の処理が終わるまで時間がかかる場合があります。音声認識中は、そのセッションの波形のクリック・ドラッグ・拡大縮小・中央固定切替は操作できません。音声認識終了後に再び操作できます。別のセッションで作業しても、開始したセッションの処理は続きます。正常に完了すると、音声認識された発話時間だけを消費し、予約した有効範囲の長さとの差分は残り時間へ戻ります。認識結果のない無音ファイルなら消費は0です。

    認識結果の保存が終わると「ファイル認識が完了しました」とローカル通知します。画面を閉じていても、別のセッションで作業していても対象です。キャンセルや失敗の場合は完了通知を出しません。

    通知について →
  9. 動画を再生して結果を確認・修正する

    「編集」に切り替え、各行の再生ボタンや動画プレビューを使って誤認識を直します。

    編集方法 →
  10. 必要な形式で書き出す

    「書き出し」から文字記録ならテキスト/CSV、動画字幕なら「字幕用(SRT / SBV)」を選びます。日本語字幕は「。」を文字数より優先して分け、音声認識時のタイムタグから表示時刻を割り当てます。「はい」「うん」などだけの字幕を除外する設定は初期状態でオンです。「その他」を選ぶと分割設定は表示されず、認識結果1件を1つの字幕にします。

    字幕の分割設定 →

    字幕の区切りや表示時刻を先に編集する場合は、セッションの「…」から「字幕編集版を作成…」を選びます。同じ分割・相槌削除の設定を使い、元の認識結果は変更しません。

    字幕編集版の作成・編集 →
完了の目印

SRTまたはSBVを書き出し、元動画と一緒に動画プレーヤーへ読み込んで、字幕の開始時刻と本文が合っていれば完成です。