京东开源JoyAI-Video-Edit:视频「边播边改」,实时流式编辑颠覆内容创作
2026年8月5日,京东正式宣布开源自研实时流式视频编辑模型JoyAI-Video-Edit。该模型打破传统视频「先成片再剪辑」的固有模式,用户可以在视频播放过程中,一边观看一边实时修改画面中的人物、场景、物体及整体风格,无需等待整段素材处理完成。这一能力在业内尚属首创,京东黑板报将此描述为「让视频创作从『先有素材再修改』变为可实时互动编辑」。
技术突破:从「后剪辑」到「流式实时」
传统视频编辑依赖后期处理,流程冗长、反馈周期慢。JoyAI-Video-Edit 依托 JoyAI 基础大模型底座,实现了对视频流的实时推理与修改,无需预设视频时长即可稳定处理连续画面。设备在 720P 分辨率下可稳定实现每秒 30 帧(30 FPS),画面处理无明显延迟卡顿,适配常规视频播放同步修改需求。
权威评测:全面领先全球同类模型
在 OpenVE-Bench 通用评测基准中,JoyAI-Video-Edit 对比当前业内所有流式编辑方法,各项指标全面领先,尤其在以下任务中优势突出:
| 评测任务 | JoyAI-Video-Edit 表现 | 行业同类水平 |
|---|---|---|
| 全局风格迁移 | ★★★★★ 领先 | ★★★ |
| 局部物体替换 | ★★★★★ 领先 | ★★★ |
| 局部物体删除 | ★★★★★ 领先 | ★★ |
| 字幕编辑同步 | ★★★★★ 领先 | ★★★ |
| 实时流式推理速度 | 30 FPS @ 720P | 通常 5~15 FPS |
应用场景:从零售营销到自动驾驶训练
JoyAI-Video-Edit 的实时流式编辑能力可覆盖多类真实场景:
- 零售营销:直播带货中实时替换商品展示背景,缩短内容制作周期;
- 家装设计:用户实时预览家具摆放、装修风格切换效果;
- 影视制作:导演现场实时调整演员位置与场景元素,大幅提升拍摄效率;
- 自动驾驶数据合成:模型可模拟极端天气、复杂路况等低频场景,为系统测试和训练自动化生成海量真实感视频数据,解决具身智能训练中数据稀缺的核心痛点。
开源与部署现状
京东已开放模型权重、部署代码和在线演示。消费级显卡适配仍在推进中,预计未来将降低中小企业和个人创作者的使用门槛。京东同时透露,该技术将为其建设全球最大物理世界运营中心提供底层支撑。
FAQ
Q1:JoyAI-Video-Edit 与普通视频滤镜有何本质区别?
滤镜和美颜作用于整个画面或人脸区域,是像素级风格变换;JoyAI-Video-Edit 则基于大模型理解语义,可在播放过程中对特定人物、物体或场景进行语义级实时替换与修改,技术含量和计算复杂度完全不同。
Q2:30 FPS 的实时性是如何实现的?
JoyAI-Video-Edit 采用流式推理架构,不需要等待整段视频处理完毕,而是逐帧连续处理。依托 JoyAI 基础大模型底座的推理优化,720P 分辨率下稳定达到 30 FPS,基本与标准视频帧率同步。
Q3:普通用户现在能否使用这一技术?
目前已开放模型权重、部署代码和在线演示。面向消费级显卡的本地适配仍在推进,中小企业和开发者可先行通过云端演示体验。
Q4:该技术对具身智能训练有何意义?
具身智能(如人形机器人、自动驾驶)需要大量真实场景视频数据进行训练,但低频场景(如暴雪、泥泞路面)数据采集成本极高。JoyAI-Video-Edit 可自动化合成这类稀缺场景视频,大幅降低训练数据获取成本,加速具身智能算法迭代。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容