はじめに
こんにちは、KUDs です。
このたび、AIで音声・動画の文字起こしと翻訳ができる Web サービス「AI Transcriber」を公開しました。
音声ファイルや動画ファイルをアップロードするだけで、話者ごとに分かれた文字起こしと、18言語への翻訳をAIが自動で作成します。
無料プランはクレジットカードの登録なしで利用できますので、まずは触ってみていただけると嬉しいです。
AI Transcriber とは?
ひとことで言うと、音声・動画をアップロードすると、話者分離つきの文字起こしと翻訳を作ってくれるサービスです。
できることは大きく3つです。
- 文字起こし: 誰がどこで話したかを判別し、話者ごとに色分けして表示します
- 翻訳: 文字起こしの結果を18言語のいずれかに翻訳します(翻訳せず文字起こしだけ、も選べます)
- 学習モード: 字幕を穴埋めにしたり、行単位でリピートしたり、速度を落としたりして、語学学習の教材として使えます
いわゆる議事録ツールとしても使えますが、語学学習で使うことを一番に考えて作ったのが AI Transcriber の特徴です。
なぜ開発したのか?
きっかけは、KUDs 自身が海外の動画やポッドキャストを教材にしようとして、毎回つまずいていたことでした。
自動字幕は付くけれど翻訳が変、翻訳は付くけれど原文が消える、聞き取れなかった一行だけをもう一度聞き直したいのに、シークバーを何度も往復するはめになる。
「原文と訳を並べて出して、聞き取れなかった行だけを何度でも繰り返せる道具」が欲しかったのですが、探しても意外と見つかりませんでした。
無いなら作るか、ということで、まず自分が毎日使うものとして作り始めたのが AI Transcriber です。
そのため、機能の優先順位は「議事録として綺麗に出る」ことよりも、「聞き取り練習の道具として手に馴染む」ことに寄っています。
AI Transcriber でできること
話者分離つきの文字起こし
アップロードした音声・動画を解析し、「誰が話しているか」を判別して話者ごとに色分けして表示します。
対談やインタビュー、複数人の会議でも、発言者が入れ替わったところが一目で分かります。
原文と訳文は上下に並べて表示され、原文だけ・訳文だけ・両方(話者ラベル付き)をワンクリックでクリップボードにコピーできます。
18言語に対応
対応言語は以下の18言語です。
英語 / 日本語 / 中国語 / スペイン語 / フランス語 / ドイツ語 / イタリア語 / ポルトガル語 / オランダ語 / スウェーデン語 / ノルウェー語 / デンマーク語 / フィンランド語 / トルコ語 / ベトナム語 / ヒンディー語 / アラビア語 / ヘブライ語
ポイントは、入力(話されている言語)・翻訳先・画面の表示言語が、すべて同じ18言語であることです。
つまり「英語の動画をフランス語に訳して、画面はスペイン語で使う」といった組み合わせも成立します。日本語話者向けだけのサービスではありません。
アラビア語・ヘブライ語では、画面全体が右から左(RTL)のレイアウトに切り替わります。
音声に合わせて単語が光る字幕プレイヤー
再生に合わせて、いま読まれている単語が1語ずつハイライトされます。カラオケのような表示です。
聞き取れなかった箇所で目を止めれば、そこが今どこなのかがすぐ分かります。
また、任意の単語をクリックするとその時刻へジャンプします。「この単語のところからもう一度」がワンクリックでできます。
語学学習のための「学習モード」
AI Transcriber で一番力を入れたのがこの機能です。
- 字幕の3モード切替: 「表示 / 穴埋め / 非表示」を
Bキーで循環できます - 穴埋め(ディクテーション): 字幕の一部の単語を伏せ字にします。伏せる割合は 10%〜70% の範囲で調整でき、既定は30%です
- 行ごとの答え合わせ: 聞き取れなかった行だけ、
⌫キーで答えを開けます - 行リピート:
Enterキーで、いまフォーカスしている行だけを繰り返し再生します - 再生速度: 0.5 / 0.75 / 1 / 1.25 / 1.5 / 1.75 / 2 倍(YouTube と同じ刻みにしてあります)
- 翻訳の表示 ON/OFF:
Tキー。まず原文だけで挑戦して、降参したら訳を出す、という使い方ができます
穴埋めで伏せられる単語は毎回同じになるように作ってあります。
画面を描き直すたびに穴の位置が変わってしまうと答え合わせにならないためです。
また、割合を30%から50%に上げたときは「いまの穴はそのままで、新しい穴が増える」挙動になります。
なお、1文字の単語と句読点は伏せません。日本語の「は」「が」「を」を伏せても聞き取りの練習にならないためです。
全画面で字幕・翻訳を重ねて観られる
F キー(または全画面ボタン)で全画面にすると、映像の上に原文の字幕と翻訳を重ねたまま視聴できます。映画やドラマを字幕付きで観る感覚に近い形です。
全画面でも学習モードの機能はそのまま使えるので、穴埋めにしたまま全画面で観る、といったことができます。
見た目は次の3つを調整できます。
- 表示位置: 上 / 中央 / 下(映像に焼き付いている字幕を避けられます)
- 文字サイズ: 60%〜200%(画面幅に対する相対値なので、スマホでもテレビでも破綻しません)
- 書体: 標準 / インパクト / 明朝 / 丸ゴシック / 細字 の5種類
書体については、Web フォントを一切読み込まない方針にしています。
字幕はどんな文字が出るか事前に決められず、日本語や中国語のフォントを丸ごと読み込むと数MBになってしまうためです。端末に元から入っている書体を系統ごとに指定し、太さ・縁取り・字送りで印象の差を作っています。追加のダウンロードが無いので、表示が遅れることもありません。
無音カットとノイズ低減
アップロード時に「無音部分をトリミングする」を有効にすると、話していない区間を取り除いてから処理します。処理が速くなり、消費する時間も減ります。
設定は2軸で、それぞれ日本語の説明つきで選べます。
- 背景ノイズの大きさ: なし(防音スタジオ)/ 小さい(静かな部屋)/ 普通(一般的な室内)/ 大きい(カフェや街頭)
- トリミングの強さ: 消極的に / 普通に / 積極的に
「普通に」は自然さと速さのバランス型で、語学学習に向いた設定です。
ひとつ正直にお伝えしておくと、トリミングを強くしすぎると話者の識別精度が下がることがあります。
そのため既定では控えめな設定にしてあります。また、動画ファイルにはトリミングは適用されません(ノイズ低減のみ行います)。
こんな方におすすめ
想定されるユーザー層は?
- 語学学習をしている方 … 海外の動画・ポッドキャストを、そのまま聞き取り練習の教材にできます
- 海外の動画をよく観る方 … 原文と訳を並べて確認できるので、自動字幕だけでは分からない部分を潰せます
- ショート動画・切り抜きを作る方 … 全画面の字幕表示はそのまま画面収録できる見た目にしてあります
- 会議やインタビューを記録したい方 … 話者分離があるので「誰が何を言ったか」が残ります
- 多言語のチームで働いている方 … 18言語の任意の組み合わせで文字起こしと翻訳ができます
利用するメリットは?
- 原文と訳が同時に残る
- 自動字幕を翻訳すると原文が消えてしまう、という問題が起きません
- 訳文だけ・原文だけ・両方、を用途に応じてコピーできます
- 「聞き直す」操作が速い
- 単語クリックでその時刻へジャンプ、
Enterで行リピート、←→で3秒シーク - キーボードだけで操作が完結するので、マウスに持ち替える必要がありません
- 単語クリックでその時刻へジャンプ、
- タイムスタンプに嘘がない
- 文を勝手に区切り直していないため、表示されている行の時刻は実際の発話位置と一致します
- 見た目を整えるために文を分割すると、区切り位置の時刻を機械が「でっち上げる」ことになるので、あえてやっていません
AI Transcriber の使い方
使い方動画
まず、ひととおりの流れを動画でご覧ください。
ステップ1: 無料登録する
現状、AI Transcriber はメールアドレスでの登録後に画面が使える形になっています。
トップページを開くとサインイン画面が表示されますので、初回は「Create Account」から登録してください。
無料プランはクレジットカードの登録が不要です。登録後すぐに毎月30分ぶんの文字起こしが使えます。
ステップ2: ファイルをドロップして言語を選ぶ
ログインすると、画面の中央に大きなドロップゾーンが出ます。ここに音声・動画ファイルをドロップするか、クリックしてファイルを選択します。
対応している形式は以下のとおりです。
- 音声:
.mp3/.m4a/.wav - 動画:
.mp4/.webm(※ 動画は Light プラン以上でご利用いただけます)
ドロップゾーンの下で、入力言語と翻訳先を選びます。
翻訳先で「翻訳なし(文字起こしのみ)」を選べば、翻訳を行わず文字起こしだけを作ることもできます。
ここで選んだ設定は保存され、次回もそのまま使えます。
必要なら、前述の無音トリミングをここで有効にします。
ドロップすると自動的に処理が始まりますので、実行ボタンを押す必要はありません。
ステップ3: 処理を待つ
処理中は「音声処理 → 文字起こし → 翻訳」の3段階が表示され、いまどの段階にいるかが分かります。
処理が終わるまで、このタブは開いたままにしておいてください。
ステップ4: 結果を見る・学習モードで使う
処理が終わると結果画面に切り替わります。
- 上部にプレーヤー(動画ファイルなら映像、音声ファイルならオーディオプレーヤー)
- 下部に文字起こしと翻訳が並んだセグメントの一覧
- 右端に学習パネル(字幕モード・翻訳の表示・穴埋め率・再生速度)
MODE ボタンで分割表示(Split View)に切り替えると、プレーヤーと文字起こしを左右に並べられます。境界はドラッグで自由にリサイズできます。
AUTO ボタンをオンにすると、再生に合わせて文字起こしが自動でスクロールします。
過去に処理したファイルは履歴に残り、スターを付けたり、投稿日・名前で並べ替えたりできます。
キーボードショートカット一覧
学習モードの操作はキーボードで完結します。
| キー | 動作 |
|---|---|
Space | 再生 / 一時停止 |
↑ ↓ | 前後の行へ移動 |
← → | 3秒シーク |
, . | 再生速度を下げる / 上げる |
Enter | フォーカスしている行をリピート |
⌫ | フォーカスしている行の答えを見る |
B | 字幕の表示を切替(表示 → 穴埋め → 非表示) |
T | 翻訳の表示を切替 |
M | ミュート切替 |
F | 全画面の切替 |
Esc | 全画面を終了 |
スマートフォンではキーボードが使えないため、同じ操作を画面右端のフローティングパネルにまとめてあります。
料金プラン
無料の Free プランに加えて、Light / Pro / Ultra の3つの有料プランがあります。
| Free | Light | Pro | Ultra | |
|---|---|---|---|---|
| 月額 | $0 | $9.99 | $29.99 | $99.99 |
| 年額 | ― | $99 | $299 | $999 |
| 毎月の文字起こし時間 | 30分 | 5時間 | 15時間 | 60時間 |
| 翻訳の品質 | 標準 | 高性能AIモデル | 高性能AIモデル | 高性能AIモデル |
| 1ファイルの長さ上限 | 3分 | 30分 | 90分 | 360分 |
| 音声ファイルサイズ上限 | 200MB | 500MB | 1GB | 2GB |
| 動画ファイルサイズ上限 | ― | 1GB | 2GB | 5GB |
| 使えるファイル形式 | mp3 / m4a / wav | 左記 + mp4 / webm | 同左 | 同左 |
| ファイルが残る期間 | 最終アクセスから30日 | 期限なし | 期限なし | 期限なし |
| 保存できるファイル数 | 5件 | 50件 | 150件 | 500件 |
補足しておきたい点は以下のとおりです。
- 表示価格は米ドル(USD)です。 お支払い時に各カード会社のレートで日本円に換算されます
- 年額プランは月額のおよそ2か月ぶんお得です(例: Light は $9.99 × 12 = $119.88 → $99)
- 毎月の文字起こし時間は、アップロードしたファイルの長さ(トリミング前)のぶんだけ消費されます
- ファイルが残る期間は最終アクセスからの日数です。使い続けている限りファイルは削除されません
- 保存できるファイル数の上限に達すると新しい処理を開始できなくなりますが、既存のファイルが自動的に削除されることはありません
- 年額プランでも、使える時間は毎月リセットされます(1年ぶんをまとめて使うことはできません)
無料プランでどこまでできる?
Free プランでできること・できないことを正直に書いておきます。
できること:
- 毎月30分ぶんの文字起こしと翻訳
- 18言語すべての組み合わせ
- 話者分離、字幕プレイヤー、学習モード、全画面字幕(機能の制限はありません)
- クレジットカードの登録なしで利用開始
できないこと・制限:
- 動画ファイルは扱えません(音声ファイルのみ。動画は Light プラン以上)
- 1ファイルは3分までです。長い動画を丸ごと、という使い方はできません
- 保存できるのは5件までで、最終アクセスから30日で削除されます
- 翻訳の品質は「標準」で、有料プランとは別のAIモデルを使っています
「機能を試す」には十分ですが、「本格的に使う」には足りない、という設計です。
まずは Free で3分の音声を1本流してみて、学習モードの手触りが自分に合うかを確かめていただくのが良いと思います。
よくある質問
Q. 毎月使える時間はいつリセットされますか?
A. 月額プランでは請求期間の更新日に、年額プランと無料プランでは毎月のサイクルでリセットされます。使い切らなかった分を翌月へ繰り越すことはできません。
Q. プランを下げたり解約したりすると、保存中のファイルはどうなりますか?
A. 下位プランへの変更と解約は、いまの請求期間が終わる時点で適用されます。変更のタイミングでファイルが削除されることはありません。保存しているファイル数が新しいプランの上限を超えていても、既存のファイルが消えることはありません。
Q. しばらくログインしないとファイルは消えますか?
A. 有料プランでは保存期間の定めがないため、放置しても削除されません。無料プランでは最後に利用した日から30日で自動的に削除されますが、アクセスのたびに期限は延びます。
Q. 処理に失敗した場合、使った時間は戻りますか?
A. こちら側の障害による失敗は、消費した時間を自動的に返却します。対応していない形式や破損したファイルなど、ファイル側に原因がある場合は処理の開始前に停止するため、そもそも時間は消費されません。
Q. 返金はありますか?
A. お支払い後の返金は承っておりません。解約後も、当該請求期間の終了日までは有料プランをご利用いただけます。
Q. 「解約」と「退会」は違いますか?
A. 違います。解約は課金を止めるだけで、データは削除されません。退会するとアカウント・ファイル・処理結果がただちにすべて削除され、復元できません。
その他のご質問は、サービス内の FAQ ページにまとめてあります。
技術的な話
システム構成について
技術寄りの話にも少しだけ触れておきます。AI Transcriber は個人開発ですが、構成は素直な AWS のサーバーレスです。
- フロントエンド: React 19 + Vite + TypeScript の SPA。CloudFront + S3 で配信
- 認証: Amazon Cognito
- API: API Gateway (HTTP API) + Lambda (Python)
- 非同期処理: S3 へのアップロードをトリガーに Lambda が起動し、前処理 → 文字起こし → 翻訳 と進みます
- データ: DynamoDB(ジョブと利用状況)+ S3(音声・動画・処理結果)
- 音声の前処理: Lambda 上の ffmpeg でノイズ低減、VAD(音声区間検出)で無音トリミング
- AI: 文字起こしは外部の音声認識AI、翻訳は Amazon Bedrock 上のAIモデルを使っています
- 決済: Stripe(Checkout + カスタマーポータル)
- IaC / CI: AWS CDK (TypeScript) + GitHub Actions(OIDC 連携)
設計で一番気をつけたのは、課金が二重にならないことです。
S3 のイベント通知は「少なくとも1回」の配信保証なので、同じアップロードで Lambda が2回起動することがあります。
そのため、処理を始める前に DynamoDB の条件付き更新でジョブを「確保」してから時間を消費する形にして、重複起動をそこで止めています。
このあたりの話は、反響があれば別記事で詳しく書こうと思います。
さいごに
AIで音声・動画を文字起こしして翻訳する Web サービス「AI Transcriber」を紹介しました。
今後のアップデートについて
公開したばかりのサービスなので、これから手を入れていく予定です。
特に、未ログインの状態でもサービスの中身が分かる紹介ページは早めに用意したいと考えています(現状はトップページを開くといきなりログイン画面が出てしまうので…)。
要望や不具合のご報告は contact@kuds.jp までお寄せください。
実際に使っていただいた方の声で直した箇所がすでにいくつもあるので、遠慮なくいただけると助かります。
会員登録について
繰り返しになりますが、無料プランはクレジットカードの登録なしで利用開始できます。
メールアドレスとパスワードだけで登録でき、毎月30分ぶんの文字起こしと翻訳が使えます。
まずは手元にある3分以内の音声ファイルを1本、投げてみてください。
KUDs の他のサービス
KUDs では他にも、動画・配信まわりの Web サービスを公開しています。あわせてご覧いただけると嬉しいです。




コメント