video-use:基于 Claude Code 的视频编辑项目

Edit videos with coding agents

分支2Tags0
文件最后提交记录最后更新时间
3 个月前
4 个月前
4 个月前
4 个月前
4 个月前
3 个月前
2 个月前
3 个月前
3 个月前
4 个月前
3 个月前

video-use

video-use

隆重推出 video-use — 借助 Claude Code 编辑视频。100% 开源。

将原始素材拖入文件夹,与 Claude Code 对话,即可获取 final.mp4。适用于各类内容——访谈、蒙太奇、教程、旅行记录、采访等——无需预设或菜单操作。

Browser Use Cloud 中试用 video-use。

功能特点

  • 智能剔除冗余内容(如 ummuh 等填充词及镜头间的无效片段)
  • 自动色彩分级 处理每个片段(可选择温暖电影感、中性冲击力或自定义 ffmpeg 处理链)
  • 30ms 音频淡入淡出 处理每处剪辑点,避免爆音
  • 自定义风格字幕嵌入 — 默认采用双词大写分段样式,支持完全自定义
  • 多引擎动画叠加生成 — 通过 HyperFramesRemotionManim 或 PIL 生成动画,由并行子代理处理,每个动画独立运行
  • 输出质量智能自检 — 在呈现最终结果前,自动评估每个剪辑边界的渲染效果
  • 会话记忆持久化 — 会话信息存储于 project.md,方便后续继续编辑

配置提示

将以下内容粘贴到 Claude Code、Codex、Hermes、Openclaw 或任何具备 shell 访问权限的代理中:

Set up https://github.com/browser-use/video-use for me.

Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that's where the editing scripts live. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.

该代理会处理克隆、依赖项、技能注册,并仅提示你输入一次 ElevenLabs API 密钥(可在 elevenlabs.io/app/settings/api-keys 获取)。

然后将你的代理指向一个包含原始素材的文件夹:

cd /path/to/your/videos
claude    # or codex, hermes, etc.

若要通过您自己的 VPS 或 Telegram 进行持续编辑,请通过 Browser Use Box 运行代理。观看 15 秒演示

在会话中:

edit these into a launch video

它会清点素材源,提出编辑策略,等待您的确认,然后在素材源旁边生成 edit/final.mp4。所有输出文件均存放在 <videos_dir>/edit/ 目录下 — 技能目录保持整洁。

手动安装

如果您希望手动操作:

# 1. Clone and symlink into your agent's skills directory
git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use        # Claude Code
# ln -sfn ~/Developer/video-use ~/.codex/skills/video-use       # Codex

# 2. Install deps
cd ~/Developer/video-use
uv sync                         # or: pip install -e .
brew install ffmpeg             # required
brew install yt-dlp             # optional, for downloading online sources

# 3. Add your ElevenLabs API key
cp .env.example .env
$EDITOR .env                    # ELEVENLABS_API_KEY=...

工作原理

LLM 从不“观看”视频,而是“阅读”视频——通过两层信息,它能获得精准到词语边界的剪辑所需的一切。

timeline_view composite — filmstrip + speaker track + waveform + word labels + silence-gap cut candidates

第一层——音频转录(始终加载)。每个素材调用一次 ElevenLabs Scribe,即可获得词语级时间戳、说话人区分以及音频事件((laughter)(applause)(sigh))。所有信息都整合到一个约 12KB 的 takes_packed.md 文件中——这是 LLM 的主要“阅读”视图。

## C0103  (duration: 43.0s, 8 phrases)
  [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted.
  [006.08-006.74] S0 We fixed this.

第二层——视觉合成(按需)timeline_view 可针对任意时间范围生成包含胶片条、波形图和文字标签的 PNG 图像。仅在决策点调用——如模糊停顿处、重拍内容对比以及剪辑点合理性检查。

常规方法:30,000 帧 × 1,500 个 token = 4500 万 token 的冗余信息。 Video Use:12KB 文本 + 少量 PNG 图像

这与 browser-use 向 LLM 提供结构化 DOM 而非截图的思路一致——但该方案是针对视频的。

流程

Transcribe ──> Pack ──> LLM Reasons ──> EDL ──> Render ──> Self-Eval
                                                              │
                                                              └─ issue? fix + re-render (max 3)

自评估循环会在每个剪切边界对渲染输出运行 timeline_view——可捕捉视觉跳变、音频爆音和隐藏字幕。只有通过评估后,你才能看到预览效果。

设计原则

  1. 文本 + 按需可视化。不进行帧 dump。 transcripts 是核心呈现形式。
  2. 音频优先,视觉为辅。剪切点基于语音边界和静音间隙确定。
  3. 询问 → 确认 → 执行 → 自评估 → 保存。未经策略批准,不得进行任何剪切操作。
  4. 不对内容类型做任何假设。先观察,再询问,然后进行编辑。
  5. 12 条硬性规则,其他方面保留艺术自由。制作规范性不容妥协,而审美则无需统一。

完整的制作规则和编辑技巧请参见 SKILL.md

项目介绍

用代码智能体编辑视频【此简介由AI生成】

定制我的领域
13922.08 K2.74 K访问 GitHub