scenelens
按场景提取视频帧、OCR 文本并合并长音频转录
- Stars
- 3
- Forks
- 0
- 更新时间
- 更新于 2026年5月8日
按场景提取视频帧、OCR 文本并合并长音频转录
SceneLens 把公开视频链接或本地视频整理成更适合 Claude 分析的输入:在镜头变化处抽帧,逐帧识别屏幕文字,并优先读取原生字幕;没有字幕时再调用 Groq 或 OpenAI Whisper,长音频会自动分块后合并时间戳。它最适合 10 分钟以内的视频,最多输出 100 帧,无法访问需要登录的私有平台。
资源类型
使用场景
运行平台
运行方式
把角色参考转成游戏实机视频提示词包
下载单个 B 站视频或批量保存 UP 主视频音频
核心能力
GitHub 公开事实最近同步于 2026年7月10日。
把路线、地点和区域变成动态地图视频
用多种生成模型完成从提示词到成片的 AI 视频制作