マニュアルのメニュー
目的 03
動画・音声ファイルの字幕作成・文字起こし
収録済みファイルを音声認識し、修正して必要な形式で保存します。
元動画・音声と時間が合った文字起こしを作り、テキスト、CSV、SRT、SBVへ書き出せます。
画像内の「Enterで2秒戻して再生」は旧表記です。現在は、文字を修正した後のEnterで修正位置の1秒前から再生します(発話の先頭より前には戻りません)。
ファイルの音声認識にはログインが必要です。 音声認識開始時に、指定した有効範囲の時間(未指定ならファイル全体)を上限として予約します。正常に完了すると、実際に音声認識された発話時間だけを消費し、無音区間など使用しなかった分は残り時間へ戻ります。
途中で手動停止した場合は、予約した有効範囲分を消費します。 開始前の確認画面で、予約する時間と現在の残り時間を確認してください。
トリミングで認識する範囲を指定する
トリミングハンドルは初期状態では非表示です。波形エリア右下の有効範囲表示の横にあるトリミングアイコンで、左右の黄色ハンドルと上下の黄色線を切り替えられます。範囲外のグレーはハンドルを隠しても表示されます。指定した開始・終了時刻は保持され、音声認識はその範囲を対象にします。
- 右下のトリミングアイコンを押す
波形に黄色い左右のハンドルと上下の線が表示されます。
- 両端のハンドルをドラッグする
左ハンドルの内側(右端)が開始時刻、右ハンドルの内側(左端)が終了時刻です。右下の範囲表示で指定時刻を確認します。
- 再生して範囲を確認する
開始より左と終了より右がグレーになります。不要な前後を認識対象から外せますが、グレー部分の波形も残り、クリックして再生できます。
- 必要に応じてハンドルを隠す
同じアイコンをもう一度押します。ハンドルを隠しても指定範囲は解除されず、範囲外のグレー表示も残ります。
ファイルの元セッションでは、波形にある開始・終了マーカーをドラッグして、音声認識の「有効範囲」を指定できます。マーカーは元ファイル上の固定時刻を示し、拡大・縮小・スクロールしても指定時刻は変わりません。画面外にあるマーカーは表示されず、その時刻までスクロールすると再び表示されます。開始より左・終了より右は薄いグレーで表示しますが、範囲外もクリックして再生できます。全範囲にするには両端をファイルの先頭・末尾へ戻します。認識中は変更できません。範囲変更直後やファイル末尾からの再開は、指定した範囲の先頭から再生します。
元ファイルと保存音声は変更せず、認識済みの発話も自動削除しません。表示時刻と字幕時刻は元ファイルの先頭基準を維持します。再認識する場合は、既存の結果を削除する確認が表示されます。
再生ゲイン(音量)を調整する
波形右側の音量スライダーで、再生音量を0〜400%に調整できます。標準は100%です。音量表示部分をダブルクリックすると100%へ戻せます。小さい録音は少しずつ増幅し、再生して聞きやすさを確認してください。
ファイルセッションでは閲覧・編集のどちらでも調整できます。リアルタイムセッションの編集時にも、録音済み音声の再生音量を調整できます。リアルタイム認識用の入力レベルとは別の設定です。
ファイル認識には、認識開始時の再生ゲインが適用されます。 開始前にトリミング範囲と音量を確認してください。後から音量を変えても、すでにある認識結果は変わりません。元ファイルや保存音声そのものは書き換えません。
0%は無音です。増幅で上限を超えた音はクリッピング処理で制限しますが、歪むことがあります。音割れした元音声を修復する機能ではありません。
認識完了後の時間を確認する
認識結果の保存と利用時間の確定が成功すると、そのセッションの画面上部に完了通知が表示されます。
- 動画・音声の長さ
- 取り込んだファイル全体の長さです。
- 認識対象の長さ
- トリミングした場合に表示される、今回の認識対象の長さです。開始前に予約する時間の基準になります。
- 実際に認識で使用した時間(発話時間)
- 今回の認識で利用時間として確定した発話時間です。アップロードや認識処理が終わるまで待った時間ではありません。無音で認識結果がなければ0になります。
時間は「時:分:秒.ミリ秒」で表示します。通知は右側の×で閉じられます。別のセッションを表示中に完了した場合は、処理したセッションへ戻ると確認できます。アプリを終了すると通知は消えます。キャンセルや失敗の場合は、この完了通知は表示されません。
ファイルから結果を作る手順
- アカウントを作成またはログインする
起動時に表示されるアカウント作成・ログイン画面で、無料アカウントを作成するか、既存のアカウントでログインします。
アカウントの詳細 → - 「新しいセッション」を押す
セッション名を入力し、種類で「動画・音声」を選びます。
- 「動画・音声ファイルを選択」を押す
文字起こししたいファイルを1つ選び、「作成」を押します。Mojidasが内部再生用の音声と波形を準備します。
- 準備完了まで待つ
「音声と波形を準備中」が消え、動画または音声のプレビューと波形が表示されるまで待ちます。別セッションへ移動しても処理は続きます。
ファイルを準備できないとき → - トリミングと再生ゲインを調整する
必要なら前後の不要部分を認識対象から外し、再生して音量を確認します。
トリミングの手順 → - 「文字起こしを開始」を押す
認識言語、使用する辞書、有効範囲の長さ(未指定ならファイル全体)をもとに予約する認識時間、現在の残り時間を確認します。正常完了後の実際の消費は、音声認識された発話時間だけです。音声で主に話されている言語を選んでください。
- 確認画面で「開始」を押す
ボタンを押した時点の最新の残り時間でもう一度確認し、有効範囲分を予約してから、アップロード、処理待ち、音声認識、結果受信の順に進みます。予約できる時間が足りない場合は開始されません。元の動画ファイルそのものは送信せず、パソコン内で準備した認識用音声だけを音声認識処理へ送ります。
- 音声認識完了まで待つ
長いファイルは、取り込み時に保存された音声の区間(目安15分、最大20分)ごとに音声認識します。全体の処理が終わるまで時間がかかる場合があります。音声認識中は、そのセッションの波形のクリック・ドラッグ・拡大縮小・中央固定切替は操作できません。音声認識終了後に再び操作できます。別のセッションで作業しても、開始したセッションの処理は続きます。正常に完了すると、音声認識された発話時間だけを消費し、予約した有効範囲の長さとの差分は残り時間へ戻ります。認識結果のない無音ファイルなら消費は0です。
認識結果の保存が終わると「ファイル認識が完了しました」とローカル通知します。画面を閉じていても、別のセッションで作業していても対象です。キャンセルや失敗の場合は完了通知を出しません。
通知について → - 動画を再生して結果を確認・修正する
「編集」に切り替え、各行の再生ボタンや動画プレビューを使って誤認識を直します。
編集方法 → - 必要な形式で書き出す
「書き出し」から文字記録ならテキスト/CSV、動画字幕なら「字幕用(SRT / SBV)」を選びます。日本語字幕は「。」を文字数より優先して分け、音声認識時のタイムタグから表示時刻を割り当てます。「はい」「うん」などだけの字幕を除外する設定は初期状態でオンです。「その他」を選ぶと分割設定は表示されず、認識結果1件を1つの字幕にします。
字幕の分割設定 →字幕の区切りや表示時刻を先に編集する場合は、セッションの「…」から「字幕編集版を作成…」を選びます。同じ分割・相槌削除の設定を使い、元の認識結果は変更しません。
字幕編集版の作成・編集 →
SRTまたはSBVを書き出し、元動画と一緒に動画プレーヤーへ読み込んで、字幕の開始時刻と本文が合っていれば完成です。
