受够了视频没听清就反复拖进度条,写了个"会看画面"的视频转笔记工具

发布于

看视频经常一句话没听清,拖回去重听好几遍还是听不清。试了现有的转写工具,发现它们只用音频——恰恰是我听不清的词,它们也转不对(幻灯片上的术语、代码里的名词,声音里根本猜不出来)。

所以做了 **Vid2notes**:转写时不只听声音,还抽帧看画面。Whisper 转文字,多模态模型拿着字幕对着截图一起读,输出带截图、章节、时间戳和 AI 总结的图文笔记,可导出 Markdown / SRT / VTT 。

支持最长 10 小时的视频,常见格式都行。

技术栈给感兴趣的 V 友:全栈 Cloudflare ( Workers AI 跑 Whisper + GLM ,Rust + FFmpeg 跑在 Containers 里),按视频 MD5 缓存不重复算。

**每天免费 3 个视频**,不用绑卡:[vid2notes](https://vid2notes.com/)

最想知道的反馈:准确率在你的视频上怎么样,尤其是带幻灯片/代码的教学视频。欢迎拍砖 🙏

---

原文链接:[点击查看](https://www.v2ex.com/t/1238109)

评论

暂无评论。

0.050443s