告别逐帧剪辑!MiniMax Design用自然语言“指挥”视频创作,AI视频进入“动嘴就行”时代

8.20 MiniMax正式发布多模态创作Agent工作台MiniMax Design,标志着AI视频创作从“操作像素”正式迈入“操作语义”的新阶段。该产品基于一个月前开源的旗舰视频模型H3构建,旨在将模型能力转化为可落地的商业生产力。

8月20日,MiniMax正式发布多模态创作Agent工作台MiniMax Design,标志着AI视频创作从“操作像素”正式迈入“操作语义”的新阶段。该产品基于一个月前开源的旗舰视频模型H3构建,旨在将模型能力转化为可落地的商业生产力。

2026-08-21_113601_930

核心突破:从“调参数”到“说意图”

与传统视频编辑工具不同,MiniMax Design的交互逻辑发生了根本性转变。用户无需精确指定每个像素的变化,只需通过自然语言表达创作意图,系统内置的Agent即可自动理解目标、拆解任务,并调用相应的模型与Skills,完成从素材生成到成片交付的全流程。

这一转变的底层支撑是H3模型的强大能力。H3是MiniMax于7月31日发布的通用全模态视频模型,能够统一理解文本、图像、视频和音频构成的多模态上下文,可生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。更为关键的是,MiniMax将H3的模型权重全面开源,使其成为首个开源旗舰级视频模型,企业和开发者可以自行部署和定制。

3D导演台与语义化工作流

MiniMax Design内置的“3D导演台”功能尤为引人注目。创作者可以通过自然语言描述场景、人物动作和镜头要求,系统会在3D空间中预演构图与人物关系,确认后再交由H3生成视频。这一设计将试错成本前置到分镜阶段,大幅降低了视频生成的资源浪费。

在产品设计理念上,MiniMax提出了两个核心判断:第一,未来的内容创作将从像素、图层、时间点的操作,转向语义层面的交互——用户只需说明想要什么、保留什么,系统负责理解意图并完成生成和编辑;第二,多模态模型需要理解的上下文将从单次输入扩展到整个项目,包括剧本、角色资产、历史版本及风格偏好。

面向商业场景的实用工具

目前,MiniMax Design已展现出在多个商业场景的实用价值:品牌方可快速批量生成营销素材;教育工作者能将教案一键转化为知识短视频;影视创作者可借助3D导演台预演镜头构图。

此外,MiniMax Design积极拥抱开源生态,支持接入ComfyUI等现有工作流,已经使用ComfyUI的专业创作者可以接入原有的本地部署方式,并让Agent协助编辑工作流节点、调整生成参数。产品现已开放下载,访问地址为design.minimaxi.com。

MiniMax Design的发布,是AI视频赛道从“模型能力竞赛”走向“生产力工具竞赛”的标志性事件。一个月前H3的开源已让视频模型“平民化”,如今Design则试图解决“模型怎么用”的问题。从“操作像素”到“操作语义”,这一转变的本质是AI从“工具”进化为“协作者”——用户不再需要学习复杂的专业软件,只需表达“想要什么”,AI负责“怎么实现”。对于内容创作者而言,这意味着创作的门槛正在被进一步拉低。