把影片或音訊丟進來。Chrome 內建的 Gemini Nano 在這個分頁轉成字幕,檔案不會上傳。
這台電腦第一次用,可能會下載本機 Nano 模型(常常好幾 GB)。下載的是模型,不是你的錄音。下面的進度是瀏覽器自己的 `downloadprogress`,不是我們估的。
把影片或音訊檔拖到這裡
mp4、webm、mov、mp3、wav、m4a — 或點一下選檔
瀏覽器對照表
轉寫靠 Chrome 的 Prompt API 吃音訊。Firefox 跟 Safari 沒這套。Edge 雖是 Chromium,這一欄只寫實際測過的。
| 功能 | Chrome | Edge | Firefox | Safari |
|---|---|---|---|---|
| Prompt API(`LanguageModel`)網頁版 Prompt API 從 Chrome 148 起。138 只給擴充功能。Edge 這邊沒測過。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
| 音訊多模態 prompt需要 `expectedInputs: [{ type: "audio" }]`。API 從 Chrome 148 起就有。這台機器仍可能因硬體或模型還沒下載而顯示 unavailable;若是這樣,沒有 Whisper 後路。Edge 這邊沒測過。 | ✓可以 | ◐部分/未測 | ✗不行 | ✗不行 |
| 在分頁裡解音訊AudioContext / OfflineAudioContext。只在 Window 有,解碼本身進不了 worker;混單聲道跟重取樣才在 worker 跑。 | ✓可以 | ✓可以 | ✓可以 | ✓可以 |
現在這個瀏覽器
- LanguageModel …
- LanguageModel audio …
- AudioContext.decodeAudioData …