AI キャプション
Beam は、有効なオーディオ クリップからローカルで音声キャプションを生成します。選択した Whisper モデルをダウンロードし、デバイス上で文字起こしし、タイムライン上に編集可能なキャプション クリップを作成します。
キャプションパネル

Screenshot pendingAdd the image at:
website/docs/public/screenshots/editor/captions-panel.webp音源
| ソース | 現れたとき | 選択ルール |
|---|---|---|
| システムオーディオ | システム役割を持つ有効なクリップが存在します。 | システムオーディオとして識別されます。 |
| マイク | マイクの役割を持つ有効なクリップが存在します。 | マイクとして識別されました。 |
| 輸入オーディオ | 有効なインポートされたオーディオ クリップが存在します。 | クリップ名を使用します。 |
| メディア URL が重複しています | 2 つの有効なクリップが同じオーディオ URL を参照します。 | 最初のソースのみが提供されます。 |
| 使えるソースが無い | 有効なオーディオ クリップには、読み取り可能なアセット URL がありません。 | 生成は利用できないままです。 |
ウィスパーモデル
| モデル | 言語 | パフォーマンス指導 |
|---|---|---|
| 小さな | 多言語対応 | デフォルトのモデル。 |
| Tiny.en | 英語 | 英語専用モデル。 |
| ベース | 多言語対応 | 追加の警告はありません。 |
| Base.en | 英語 | 英語専用モデル。 |
| 小 | 多言語対応 | WebGPU がないと遅い場合があります。 |
| Small.en | 英語 | WebGPU がないと遅い場合があります。 |
| 中 | 多言語対応 | 大量のダウンロード。 WebGPU推奨。 |
| Medium.en | 英語 | 大量のダウンロード。 WebGPU推奨。 |
| 大規模な v3 | 多言語対応 | WebGPU がないと非常に大きくて遅い。 |
モデルのダウンロードと削除
| 状態またはアクション | 行動 |
|---|---|
| 行方不明 | 選択したモデルでモデルのダウンロードが可能です。 |
| ダウンロード中 | Beam は、ダウンロードされたバイト数と合計バイト数を進行状況バーとともにレポートします。 |
| 準備完了 | チェック マークはインストールされているモデルを示し、[モデルの削除] が使用可能になります。 |
| モデルの削除 | ダウンロード、削除、転写中は利用できません。 |
| ダウンロードエラー | エラーが表示され、診断のためにコピーできます。 |
生成と再生
- 有効なオーディオ ソースの 1 つを選択します。
- 準備ができていない場合は、Whisper モデルを選択してダウンロードします。
- 「キャプションの生成」を選択します。 Beam はソースをデコードし、モノラル 16 kHz オーディオに変換し、タイムラインの長さに制限します。
- 部分的な転写結果は、処理の続行中に構成を更新します。
- 実行が完了すると、最初に生成されたキャプションが編集用に選択されます。
| 行動 | ルール |
|---|---|
| 文のグループ化 | キャプション フレーズを句読点または 12 単語の後で終了します。 |
| 生成されたクリップの最小継続時間 | 40ミリ秒 |
| 再生する | 既存の AI 生成のキャプションを置き換え、手動キャプションを保持します。 |
| キャンセル | モデルの読み込みまたは転写を停止します。 |
| パネルを閉じる | アクティブな文字起こしの実行をキャンセルします。 |
| 診断 | 経過時間をレポートし、処理後にコピー可能な転写レポートを公開します。 |
ローカル文字起こし
デバイス上で Whisper が実行されます。キャプションの生成には、クラウド アップロードや API キーは必要ありません。
生成されたキャプションを編集する
生成されたキャプションは、AI 生成としてマークされた通常の編集可能なキャプション クリップです。テキスト、タイミング、ビジュアル スタイルは、生成後に [クリップ] パネルとタイムラインを通じて調整できます。