Edit videos with coding agents
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 3 个月前 | ||
| 4 个月前 | ||
| 4 个月前 | ||
| 4 个月前 | ||
| 4 个月前 | ||
| 3 个月前 | ||
| 2 个月前 | ||
| 3 个月前 | ||
| 3 个月前 | ||
| 4 个月前 | ||
| 3 个月前 |
video-use
隆重推出 video-use — 借助 Claude Code 编辑视频。100% 开源。
将原始素材拖入文件夹,与 Claude Code 对话,即可获取 final.mp4。适用于各类内容——访谈、蒙太奇、教程、旅行记录、采访等——无需预设或菜单操作。
在 Browser Use Cloud 中试用 video-use。
功能特点
- 智能剔除冗余内容(如
umm、uh等填充词及镜头间的无效片段) - 自动色彩分级 处理每个片段(可选择温暖电影感、中性冲击力或自定义 ffmpeg 处理链)
- 30ms 音频淡入淡出 处理每处剪辑点,避免爆音
- 自定义风格字幕嵌入 — 默认采用双词大写分段样式,支持完全自定义
- 多引擎动画叠加生成 — 通过 HyperFrames、Remotion、Manim 或 PIL 生成动画,由并行子代理处理,每个动画独立运行
- 输出质量智能自检 — 在呈现最终结果前,自动评估每个剪辑边界的渲染效果
- 会话记忆持久化 — 会话信息存储于
project.md,方便后续继续编辑
配置提示
将以下内容粘贴到 Claude Code、Codex、Hermes、Openclaw 或任何具备 shell 访问权限的代理中:
Set up https://github.com/browser-use/video-use for me.
Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
该代理会处理克隆、依赖项、技能注册,并仅提示你输入一次 ElevenLabs API 密钥(可在 elevenlabs.io/app/settings/api-keys 获取)。
然后将你的代理指向一个包含原始素材的文件夹:
cd /path/to/your/videos
claude # or codex, hermes, etc.
若要通过您自己的 VPS 或 Telegram 进行持续编辑,请通过 Browser Use Box 运行代理。观看 15 秒演示。
在会话中:
edit these into a launch video
它会清点素材源,提出编辑策略,等待您的确认,然后在素材源旁边生成 edit/final.mp4。所有输出文件均存放在 <videos_dir>/edit/ 目录下 — 技能目录保持整洁。
手动安装
如果您希望手动操作:
# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use # Codex
# 2. Install deps
cd ~/Developer/video-use
uv sync # or: pip install -e .
brew install ffmpeg # required
brew install yt-dlp # optional, for downloading online sources
# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env # ELEVENLABS_API_KEY=...
工作原理
LLM 从不“观看”视频,而是“阅读”视频——通过两层信息,它能获得精准到词语边界的剪辑所需的一切。
第一层——音频转录(始终加载)。每个素材调用一次 ElevenLabs Scribe,即可获得词语级时间戳、说话人区分以及音频事件((laughter)、(applause)、(sigh))。所有信息都整合到一个约 12KB 的 takes_packed.md 文件中——这是 LLM 的主要“阅读”视图。
## C0103 (duration: 43.0s, 8 phrases)
[002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
[006.08-006.74] S0 We fixed this.
第二层——视觉合成(按需)。timeline_view 可针对任意时间范围生成包含胶片条、波形图和文字标签的 PNG 图像。仅在决策点调用——如模糊停顿处、重拍内容对比以及剪辑点合理性检查。
常规方法:30,000 帧 × 1,500 个 token = 4500 万 token 的冗余信息。 Video Use:12KB 文本 + 少量 PNG 图像。
这与 browser-use 向 LLM 提供结构化 DOM 而非截图的思路一致——但该方案是针对视频的。
流程
Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
│
└─ issue? fix + re-render (max 3)
自评估循环会在每个剪切边界对渲染输出运行 timeline_view——可捕捉视觉跳变、音频爆音和隐藏字幕。只有通过评估后,你才能看到预览效果。
设计原则
- 文本 + 按需可视化。不进行帧 dump。 transcripts 是核心呈现形式。
- 音频优先,视觉为辅。剪切点基于语音边界和静音间隙确定。
- 询问 → 确认 → 执行 → 自评估 → 保存。未经策略批准,不得进行任何剪切操作。
- 不对内容类型做任何假设。先观察,再询问,然后进行编辑。
- 12 条硬性规则,其他方面保留艺术自由。制作规范性不容妥协,而审美则无需统一。
完整的制作规则和编辑技巧请参见 SKILL.md。