JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型
JoyAI-Video-Edit 又有新动向了。这篇速览它最近更新了什么、对普通用户意味着什么。
JoyAI-Video-Edit最近有什么动向
JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。用户可通过自然语言指令在视频播放过程中实时修改人物、场景、风格及物体,无需等待完整视频生成。模型在OpenVE-Bench评测中超越所有流式编辑方法,各项指标全面领先,同时可为具身智能提供大规模数据合成路径。
几个关键亮点
- JoyAI-Video-Edit是什么:JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流
- JoyAI-Video-Edit的主要功能:实时流式编辑:视频帧到达时即时编辑,无需预先知道完整序列。开放式指令控制:支持全局风格迁移、局部对象增删改、背景替换、动作调整及参考图引导编辑。任意时长处理:突
- JoyAI-Video-Edit的技术原理:MLLM条件编码器:用多模态大语言模型将自然语言指令编码为编辑条件,实现开放式语义控制。因果视频VAE:采用因果时序结构的变分自编码器对视频帧进行压缩与重建,保
功能细节
JoyAI-Video-Edit是什么
JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。用户可通过自然语言指令在视频播放过程中实时修改人物、场景、风格及物体,无需等待完整视频生成。模型在OpenVE-Bench评测中超越所有流式编辑方法,各项指标全面领先,同时可为具身智能提供大规模数据合成路径。

JoyAI-Video-Edit的主要功能
- 实时流式编辑:视频帧到达时即时编辑,无需预先知道完整序列。
- 开放式指令控制:支持全局风格迁移、局部对象增删改、背景替换、动作调整及参考图引导编辑。
- 任意时长处理:突破秒级或分钟级限制,可持续随视频播放进行稳定编辑。
- 720P高吞吐部署:端到端pipeline在720×1280分辨率下达30.19 FPS。
- 多维度编辑能力:覆盖人物换装、场景变换、风格转换、物体替换与字幕编辑等任务。
JoyAI-Video-Edit的技术原理
- MLLM条件编码器:用多模态大语言模型将自然语言指令编码为编辑条件,实现开放式语义控制。
- 因果视频VAE:采用因果时序结构的变分自编码器对视频帧进行压缩与重建,保证流式场景下的时序一致性。
- 16B参数MMDiT骨干:用16B多模态扩散Transformer为核心,融合文本与视觉特征进行自回归扩散生成。
- 自回归分布匹配蒸馏:通过对齐自回归分布的蒸馏策略加速推理,显著降低训练与推理的分布差异。
- 长时域优化与有界KV推理:引入长时域稳定性优化及有界KV缓存机制,抑制累积时序漂移并维持高吞吐量。
如何使用JoyAI-Video-Edit
- 环境准备:创建Conda环境
python=3.10并安装requirements.txt依赖。 - 下载权重:从Hugging Face获取模型文件,按指定目录结构放置检查点。
- 启动服务:进入
deploy目录执行bash run_server.sh启动本地服务器。 - 访问界面:浏览器打开
http://localhost:8080进入交互式编辑界面。 - 实时编辑:上传视频或接入摄像头流,输入自然语言指令即可边播边改。
JoyAI-Video-Edit的核心优势
- 实时流式编辑:视频帧到达即处理,无需等待完整序列,实现真正的”边播边改”交互体验。
- 速度与质量双优:720P分辨率下端到端推理达30.19 FPS,在OpenVE-Bench评测中超越所有流式与离线编辑方法。
- 任意时长稳定输出:突破传统模型仅支持秒级或分钟级片段的限制,可持续随视频播放进行无漂移稳定编辑。
- 开放式语义控制:基于MLLM条件编码器,支持自然语言指令驱动的全局风格、局部对象、背景替换及参考图引导等多维度编辑。
- 高效推理架构:16B参数自回归扩散Transformer配合分布匹配蒸馏与有界KV缓存,显著降低训练推理差异并抑制时序累积误差。
JoyAI-Video-Edit的项目地址
- GitHub仓库:https://github.com/jd-opensource/JoyAI-Video-Edit
- HuggingFace模型库:https://huggingface.co/jdopensource/JoyAI-Video-Edit
- arXiv技术论文:https://arxiv.org/pdf/2608.03974
JoyAI-Video-Edit的同类竞品对比
| 维度 | JoyAI-Video-Edit | SANA-Streaming |
|---|---|---|
| 模型规模 | 16B参数 | 2B参数 |
| 推理速度 | 37.21 FPS (DiT) | 约54 FPS (DiT) |
| 编辑质量 | 3.60 (OpenVE-Bench) | 约2.6 |
| 编辑类型 | 开放式多维度编辑 | 流式编辑 |
| 分辨率支持 | 720P稳定输出 | 较低分辨率为主 |
| 时序稳定性 | 任意时长,有界KV优化 | 短片段为主 |
JoyAI-Video-Edit的应用场景
- 短视频创作:创作者可在视频播放过程中实时替换人物服装、调整场景风格,提升内容生产效率。
- 直播实时特效:主播边播边改背景或添加虚拟元素,实现互动式直播视觉增强。
- 家装与室内设计:用户在浏览房间视频时实时更换家具、墙面材质与灯光效果,辅助装修决策。
- 影视后期预演:导演在剪辑阶段快速尝试不同视觉风格与场景替换,降低试错成本。
- 具身智能数据合成:将人手操作视频转化为机械臂操作素材,低成本扩展机器人训练数据规模。
对普通用户意味着什么
新能力落到实际,意味着你能用更低门槛试到「京东开源的实时流式视频编辑模型」。建议先拿小任务验证,确认稳定再往日常流程里放;关键输出仍要人工把关。
常见问题
JoyAI-Video-Edit是什么,主要解决什么问题
JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。用户可通过自然语言指令在视频播放过程中实时修改人物、场景、风格及物体,无需等待完整视频生成。模型在OpenVE-Bench评测中超越所有流式编辑方法,各项指标全面领先,同时可为具身智能提供大规模数据合成路径。
JoyAI-Video-Edit开源吗
JoyAI-Video-Edit已开源(正文已说明其开源版本与本地部署方式),具体许可协议以官方仓库公示为准。
JoyAI-Video-Edit怎么上手 / 怎么用
访问官网或对应平台(文内链接)注册或下载即可体验;开源版本按官方仓库说明本地部署,消费级显卡大多能跑。
JoyAI-Video-Edit和同类工具比,选哪个
JoyAI-Video-Edit侧重「京东开源的实时流式视频编辑模型」;选哪个看你是个人尝鲜还是企业落地,建议先试免费或开源版再决定。
JoyAI-Video-Edit适合谁用,不适合谁
适合想快速体验新能力、做原型或本地部署的开发者与爱好者;涉及生产级稳定性、合规审计的场景,先评估再上车,别直接当关键链路。

评论(0)