今天(20日),通用AI科技公司MiniMax发布多模态创作Agent工作台MiniMax Design ,进一步释放原生多模态视频模型H3的生产力,推动模型能力进入商业内容生产流程。

MiniMax Design是一款多模态创作Harness 。用户提出创作需求后,Agent能够理解目标、拆解任务 ,并调用相应的模型与技能(Skills),完成素材处理 、内容生成、编辑和最终交付。

H3具备多模态理解、视频生成 、视频编辑和借鉴 控制等能力,尤其适合Video Editing等对理解、控制与修改要求较高的任务。MiniMax Design在此基础上继续解决任务规划、素材组织和多环节协作问题 ,让模型能够参与内容从构思到交付的完整过程 。作为MiniMax 围绕H3构建的创作产品,MiniMax Design把对模型能力边界 、输入方式和使用方法的理解沉淀在Agent与Skills中。

面对一项具体任务,MiniMax Design可以判断需要提供哪些文字、图片、视频和音频 ,并识别其中需要借鉴 或保留的内容,将创作需求转化为适合H3执行的素材和指令,补充音视频生成前的分镜规划 ,以及生成后的剪辑和成片装配能力。

例如,其亮点功能“3D导演台”可以根据场景 、人物动作和镜头要求,在3D空间中摆放角色、调整姿态与机位,并从不同视角检查画面 。用户确认构图和人物关系后 ,系统再将结果作为H3生成视频的借鉴 ,将部分试错提前到分镜阶段。镜头生成完成后,MiniMax Design还可以继续完成自动剪辑和字幕添加 ,将分散的素材组织为完整视频。
MiniMax Design擅长处理目标明确、涉及多个制作环节,并且需要持续生成和修改的商业内容任务 。在KOC 、UGC、电商种草和带货视频等场景中,MiniMax Design可以理解商品信息和传播目标 ,规划脚本与镜头,并继续完成素材生成、剪辑和字幕,让一套商品素材更快转化为多个可用版本。在教育科普和MG动画等知识内容场景中 ,用户可以直接提供教案、课件或知识点,MiniMax Design会梳理内容结构和讲解顺序,再组织配音 、画面和动画表达 ,将文字材料逐步制作成完整视频。
对于PV、MV、电影片头 、特效包装和角色宣传片等创意短片,MiniMax Design可以结合H3的生成、借鉴 控制和视频编辑能力,由Agent规划整体创意与镜头,Skills执行具体制作环节 ,支持连续生成、精细控制和反复修改,减少创作者在多个专业工具之间切换的成本 。

围绕H3开源后形成的创作者生态,MiniMax Design已将部分社区工作流集合到产品中。已经使用ComfyUI的专业创作者也可以接入原有的本地部署方式和成熟工作流 ,选取 云端或本地运行,并让Agent根据对话协助编辑工作流节点 、调整生成参数。
自然语言将逐步成为人与多模态内容交互的重要接口。用户负责表达创作意图,Agent负责理解、规划和执行 ,模型与工具则在统一工作流中完成具体任务 。“MiniMax Design是MiniMax将H3的模型能力进一步组织为商业内容生产力的产品实践。”MiniMax相关负责人表示,“与此同时,我们欢迎用户在产品中探索或创建更加有趣、实用的开源工作流 ,让开源社区中的探索沉淀为可复用的生产能力,进一步拓展H3的应用范围。 ”

值得一提的是,MiniMax分享了对多模态生产力的两个判断:首先 ,未来的内容创作与修改将逐步从像素 、图层、时间点和参数操作,转向语义层面的交互 。用户只需说明想要什么、改变什么和保留什么,系统负责理解意图,并完成相应的生成 、修改、重组和编辑。
其次 ,多模态模型需要理解的Context将从一次输入扩展到整个Project。一项完整的内容任务通常包含多轮对话,以及剧本、图片、视频 、音频、人物、场景 、道具和品牌资产 。不同版本及其修改记录也会成为后续创作的上下文。Context长度之外,模型能否理解并有效使用这些内容 ,将影响其处理复杂任务的能力。
(文章来源:上观新闻)