InstructAV2AV – 智源联合北大开源的音视频联合编辑模型
InstructAV2AV 最近在 AI 工具圈讨论挺多。把它和同类放一起比一比,看看你该不该上车。
InstructAV2AV是什么
InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应声音,无需手工掩码或分步处理。模型支持台词修改、人物替换、对象插入与删除,能保持背景与环境声不变,维持声画时间同步。
和同类工具横评
| 维度 | InstructAV2AV | 同类通用方案 |
|---|---|---|
| 核心定位 | 智源联合北大开源的音视频联合编辑模型 | 通用 AI 能力 |
| 上手成本 | 低(官网/开源即可) | 视具体工具 |
| 部署方式 | 支持本地部署(开源) | 视具体工具 |
| 适合人群 | 开发者 / 爱好者 | 视具体工具 |
功能细节
InstructAV2AV是什么
InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应声音,无需手工掩码或分步处理。模型支持台词修改、人物替换、对象插入与删除,能保持背景与环境声不变,维持声画时间同步。

InstructAV2AV的主要功能
- 身份保持的语音修改:在保留人物形象的前提下只替换其说话内容。
- 音视频实例替换:把画面中的指定人物连同其声音和台词一起更换。
- 实例插入:向画面添加新对象并自动生成与之同步的声音。
- 实例移除:删除指定对象及其在音轨中的对应声音。
- 属性组合编辑:人物外观、说话内容和音色可分别独立修改并自由组合。
InstructAV2AV的技术原理
- 源潜变量拼接:将源视频与源音频的潜变量与噪声沿通道维度拼接,使源内容成为整个去噪过程的结构条件,约束模型保留背景、无关对象和环境声,避免”改一个目标、重绘整个世界”。
- SIGA 门控注意力:Source-Instruction Gated Attention 让每个 token 同时与源特征和指令特征交互,通过可学习的软门控逐位置决定改多少、留多少,实现内容保留与指令执行的动态平衡。
- 双流交互架构:基于 Ovi 对称双流扩散 Transformer,视频与音频分支各自自注意力建模后,通过双向跨模态注意力交换特征,使视觉运动与声音事件相互约束、保持同步。
- 两阶段训练:关闭跨模态注意力分别训练单模态编辑能力,再恢复完整架构联合微调,学习声画之间的细粒度对应关系。
- 自动化数据流水线:通过素材筛选、编辑目标合成、五维自动评估加人工复核三阶段构建 InsAVE-80K 数据集,解决成对训练数据稀缺问题。
如何使用InstructAV2AV
- 克隆代码:从 GitHub 克隆 InstructAV2AV 代码仓库到本地。
- 配置环境:按照仓库说明配置 Python 环境并安装所需依赖。
- 下载权重:从 Hugging Face 下载 InstructAV2AV 模型权重。
- 准备素材:准备一段带声音的视频素材作为输入。
- 输入指令:输入一句自然语言编辑指令,描述想要修改的内容。
- 运行推理:运行推理脚本,等待模型生成编辑后的视频与音频。
- 保存结果:查看输出结果并保存编辑完成的音视频文件。
InstructAV2AV的项目地址
- 项目官网:https://hjzheng.net/projects/InstructAV2AV/
- GitHub仓库:https://github.com/suimuc/InstructAV2AV
- HuggingFace模型库:https://huggingface.co/suimu/InstructAV2AV
- arXiv技术论文:https://arxiv.org/pdf/2605.18467
InstructAV2AV的同类竞品对比
| 对比项 | InstructAV2AV | Ovi |
|---|---|---|
| 产品定位 | 指令驱动的音视频联合编辑模型 | 音视频联合生成模型 |
| 核心能力 | 在源视频基础上修改画面与声音 | 从零生成视频与音频 |
| 输入方式 | 源视频+源音频+自然语言指令 | 文本提示词(从零生成) |
| 背景保留 | 精准保留无关背景与环境声 | 不涉及源内容保留 |
| 声画同步 | 双向跨模态注意力保证编辑后同步 | 生成时同步,不支持编辑场景 |
| 技术架构 | 基于 Ovi 双流扩散 Transformer 改造,加入源潜变量拼接与 SIGA 门控 | 对称双流扩散 Transformer |
| 适用场景 | 台词修改、人物替换、对象插入与移除 | 文本到音视频的创意生成 |
InstructAV2AV的应用场景
- 影视后期:影视后期人员用它替换演员台词并同步口型,降低补拍成本。
- 短视频制作:短视频创作者用它一句话修改素材中的人物与声音,提升创作效率。
- 虚拟人:虚拟人运营团队用它调整数字人的外观、音色与说话内容。
- 广告创意:广告从业者用它批量生成不同人物与台词版本的宣传视频。
- 交互式内容生产:游戏与教育工作者用它动态生成音画一致的多媒体素材。
什么时候选它,什么时候选别的
如果你要的是「智源联合北大开源的音视频联合编辑模型」、想快点跑通,InstructAV2AV 值得试;如果要的是更通用或已深度集成的工作流,先看手头已有的工具是否够用,别为了新鲜感反复切换。
常见问题
InstructAV2AV是什么,主要解决什么问题
InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应声音,无需手工掩码或分步处理。模型支持台词修改、人物替换、对象插入与删除,能保持背景与环境声不变,维持声画时间同步。
InstructAV2AV开源吗
InstructAV2AV已开源(正文已说明其开源版本与本地部署方式),具体许可协议以官方仓库公示为准。
InstructAV2AV怎么上手 / 怎么用
访问官网或对应平台(文内链接)注册或下载即可体验;开源版本按官方仓库说明本地部署,消费级显卡大多能跑。
InstructAV2AV和同类工具比,选哪个
InstructAV2AV侧重「智源联合北大开源的音视频联合编辑模型」;选哪个看你是个人尝鲜还是企业落地,建议先试免费或开源版再决定。
InstructAV2AV适合谁用,不适合谁
适合想快速体验新能力、做原型或本地部署的开发者与爱好者;涉及生产级稳定性、合规审计的场景,先评估再上车,别直接当关键链路。

评论(0)