把正在播直播的那個分頁分享出來,記得勾「分享分頁音訊」,這一頁就會把聽到的內容打成字幕再翻成你的語言。辨識跟翻譯都在你這台機器上跑,音訊不會傳出去。
正在確認這台機器有沒有這組語言…
…
按開始,然後選正在播直播的那個分頁。
實測落後
字幕在這台機器上實際慢了多少:從每一段音訊講完,算到那行字幕出現在畫面上。這裡的數字全是量出來的,不是抄規格書。
還沒量到
目前 0 行 — 要算中位數至少要 3 行。
整場逐字稿
從按下開始之後辨識到的每一行都留著,時間軸從開始那一刻算起。直播結束就下載下來,關掉分頁就沒了。
還沒記到東西。
這頁做得到什麼、做不到什麼
- 字幕會落後音訊 3 到 8 秒。這不是同步字幕:一句話要講完模型才聽得到全部,模型再花好幾秒才吐得出結果。
- 口音、你一句我一句、背景配樂、直播音質差,準確度都會掉。字幕只是還不錯的猜測,不是發言記錄。
- 需要 Chrome 內建 AI(Gemini Nano)並支援音訊輸入。第一次跑會下載模型,常常好幾 GB;硬體吃不下就會回 `unavailable`,而且沒有雲端可以退。
- 抓進來的音訊、逐字稿、譯文都留在這個分頁。唯一的連線是 Chrome 自己去抓模型。
怎麼選音源
成敗就在這一步。Chrome 不主動給你音訊,忘了勾那個框,看起來就只像這一頁壞掉。
- 1按開始,Chrome 會跳出自己的分享視窗。
- 2選「Chrome 分頁」那一排,再點正在播直播的分頁。
- 3按分享之前先勾「分享分頁音訊」。沒勾的話送進來的是無聲。
分享分頁在每個平台都能用。視窗跟整個螢幕的音訊只有 Windows 有;macOS 跟 Linux 的分享視窗根本不會出現音訊選項,那就改分享分頁。
瀏覽器支援
每一列不是實測過,就是明講沒測。Edge 是 Chromium,很可能能跑,但沒有人在這一頁上試過。
| 功能 | Chrome | Edge | Firefox | Safari |
|---|---|---|---|---|
| 抓分頁音訊對分享的分頁呼叫 `getDisplayMedia({ audio: true })` 要拿得到音訊軌。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
| 視窗/螢幕音訊`systemAudio: "include"`。只有 Windows;其他平台的分享視窗不會給這個選項。 | ◐部分/未測 | ◐部分/未測 | ✗不行 | ✗不行 |
| Prompt API(`LanguageModel`)網頁版 Prompt API 從 Chrome 148 開始。Chrome 138 只有擴充功能能用。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
| 音訊多模態要 `expectedInputs: [{ type: "audio" }]`。硬體不夠或模型還沒抓,這台機器一樣可能回 unavailable。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
| Translator API每組語言各一個本機模型。少了那一組,字幕就只有原文。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
| Document Picture-in-Picture浮出來的字幕小窗。沒有的話字幕就留在頁面裡。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
現在這個瀏覽器
- getDisplayMedia …
- display audio …
- LanguageModel …
- LanguageModel audio …
- Translator …
- documentPictureInPicture …
- wakeLock …