剪藏#剪藏#可爱的小Cherry

MiniMax 官方 CLI 来了!🦞 20 分钟搓出一部电影片段,疯了(附完整干货)

2026 年 4 月 10 日1 分钟
分享Twitter / XTelegram微博
MiniMax 官方 CLI 来了!🦞 20 分钟搓出一部电影片段,疯了(附完整干货) 封面

就在刚刚,MiniMax 发布了其首个官方命令行工具 —— MMX CLI。

一个专门为 AI Agent 打造,可以在任意 Agent 或终端中生成文字、图像、视频、音乐、语音的工具。

建议某看看,什么叫 Token Plan?这才叫 Token Plan。

  • 文本对话 — 多轮对话、流式输出、系统提示词、JSON 格式输出

  • 图像生成 — 文生图,支持比例和批量控制

  • 视频生成 — 异步生成,进度追踪

  • 语音合成 — 30+ 音色、语速调节、流式播放

  • 音乐生成 — 文生音乐,支持自定义歌词

  • 图像理解 — 图片描述与识别

  • 网络搜索 — MiniMax 搜索引擎

  • 双区域 — 国际版(api.minimax.io)和国内版(api.minimaxi.com)自动切换

Notion image

恰好这几天我一直在研究如何最大化利用 MiniMax 内的音频、视频、图片用量。

说实话,Max 套餐,每天 120 张 Image-01 生图,4 个海螺 2.3音频,以及 4 首 Muisc-2.5 的用量,不用真的很浪费。

虽然模型目前不是业内顶尖的,但是放在 25 年底的那一档里还是可以打的。

Notion image

我花了 20 分钟,全程和 Openclaw 聊天,从剧情创意、到分镜、到参考图、到音乐背景、到成片。

题材是鬼片,至于为什么这样做,后面有介绍。

先看成品,一个纯理科生,没有任何影视经验,靠着自己的理解完成。

如果看完你有触动,感觉想试试,那么再往下看,我把自己的经验,全盘托出。

一、如何使用?

首先把 CLI 工具的地址发给 openclaw,让它进行安装。

https://github.com/MiniMax-AI/cli

聪明的 agent ,装好以后会做几个测试的内容,确保服务本身是通的。

Notion image

🔻MMX quota show 查询套餐余量

Notion image

TTS、音乐、Text 就不说了。

主要来说说,我对图片,视频模型的理解。

根据套餐内容,MiniMax Token Plan 可以使用的模型有以下特点。

1. image-01(图片)

  • 文生图:prompt → 图片

  • 图生图subject_reference锁定角色一致性

  • 批量生成n=1~9,一次最多9张

  • 自定义尺寸:width/height 512-2048px(必须是8的倍数)

  • 返回格式:URL(24小时有效)或base64

2.MiniMax-Hailuo-2.3 / 2.3-Fast(视频)

不支持首尾帧、不支持主体参考!

  • 图生视频:必须传first_frame_image(公网URL或base64)

  • • 格式:JPG, JPEG, PNG, WebP

  • • 体积:小于 20MB

  • • 文生视频:仅 Hailuo-2.3 支持

  • 运镜指令:免费支持15种[指令]语法,每组不超过 3 个复合运镜。

  • 时长仅6秒

  • 分辨率仅768P

二、实战篇

纯干货,利用最合适的方法,把这些模型用量串起来。

Step 1:脚本规划

MiniMax Max 套餐每天 4 个视频是上限。

所以的工作都是围绕 4 个视频额度来做的。

所以我们必须和 AI 讨论,先设定明确的场景、分镜、提示词。

每一个分镜、运镜,至少保证 3、4 个可选项以上,用 LLMs 抽卡来弥补质量缺陷。

1️⃣ 分镜

剧本就不说了,直接让 AI 现编内容,自己升华。

重点是分镜。

建议把人物描述、场景描述、灯光分为全部纳入,包括一些硬编码的尺寸。

Notion image

2️⃣ 运镜脚本

运镜脚本很关键,hailuo-2.3 支持 6s 的视频,这 6s 可以做很多的镜头切换。

运镜脚本是画面感最重要的部分。根据前面提到的最多 3 个镜头组合的方式,把分镜细化到运镜级别的提示词。

最好再加上 [1s-2s] 这样的人工强制分镜切片。

Notion image

Step 2:角色与场景

图片的量最大,120 张每天,每组 4 张的话,我们可以做 30 组分镜场景。

先抽卡一批,[文生图],筛选剧情角色。

这里不建议用 CLI,建议直接走 API ,一次性生成 5 张以上的。

Notion image

设定 ref 角色为参考图,使用 [图生图] ,根据分镜提示词把视频的首帧做出来。

平均一个视频镜头,可以有 7 组的选择余地。

Notion image

JAVASCRIPT
# 步骤1:生成角色参考图(9张选1)
image-01: n=9, prompt="疲惫女子,深蓝oversized西装,白色圆领..."

# 步骤2:用角色参考生成4个场景(shot5/7/8/9
for shot in ["shot5""shot7""shot8""shot9"]:
    image-01 I2I
        subject_reference=[character_ref],
        n=4,  # 每张场景4张选最优
        aspect_ratio="16:9"

场景的话,选择文生图提示词。

同样是抽卡,让 AI Agent 结合剧本分镜自己写提示词做。

Notion image

Step 3:视频生成

视频提示词。

我的建议是能用首帧 [图生视频] 的,就不要做 文生视频。

它是场景一致性的延续。

比如简单的文生视频,提示词写得再好,也没办法确保一致性。

一个余量就浪费掉了。

🔻文生视频无法保证一致性

Notion image

大家不要认为首帧参考图就会固定画面。

通过运镜、提示词变化,同一个视频里的场景完全是可以做到转移的。

前 2 秒的首帧视频,只是场景内变化。

Notion image

3s 以后的场景,可以在同一个视频内的逻辑范围下,转换角度、变焦、画面。

相当于把一个视频拆开来用。

Notion image

这里再提 2 个视频生成的小技巧。

1️⃣ 6s 内多场景。

一个视频只有 6s 没错,但是很多分镜场景我们不需要用到 6s 。

所以一个 图生视频 = 首帧参考图 + 文生视频。

充分利用 6s 内的镜头变化,用来拆分出更多的短时间镜头,通过后期的镜头语言、剪辑软件进行拆分,用量就上来了。

2️⃣ 首尾帧一致性

安装 ffmpeg 插件。

通过脚本,我们对视频的最后一帧进行提取。

JAVASCRIPT
for clip, shot in [("clip5""shot5"), ("clip7""shot7")]:
    url = upload_catbox(f"{shot}.png")
    
    # Hailuo生成6秒视频
    hailuo_2.3_fast:
        first_frame_image=url,
        prompt=f"{scene_desc} [运镜指令]",
        duration=6,
        resolution="768P"
    
    # 提取尾帧供下一条使用
    extract_lastframe(f"{clip}.mp4", f"{clip}_lastframe.png")

这一帧的画面,我们继续作为下一个视频的首帧。

这样画面就连贯的。

但是这里要注意的是,跨视频不能做人物分镜。

因为第二个视频已经没有第一个视频里的人物参考图了。

这个时候镜头里的人物相当于是文生图。

上个视频还是女主角,下个视频人物一回头已经是一个男人。

所以 ffmpeg 的画面延续只能用在 上一个画面尾帧有人物正脸,或者纯场景的。

Notion image

Step 4:音频与合成

hailuo 2.3 全系列出来的视频都是默片。

没有声音。

我们需要为视频片段创建合理的背景音、语音。

音乐支持纯音乐、歌词音乐。

想要氛围感强一点的,可以将歌词替换为呢喃声,轻声低语的,比纯音乐效果更好。

Notion image

JAVASCRIPT
# 生成呢喃BGM(分段拼接)
for i in range(4):  # 4段6秒=24秒
    tts_async:
        text="嗯~嗯嗯~啦啦~啊~",
        voice_id="Chinese_Sweet_Lady"

# ffmpeg最终合成
ffmpeg_concat_video(clips=["clip5.mp4""clip7.mp4""clip8.mp4""clip9.mp4"])
ffmpeg_add_bgm(video="concat.mp4", audio="humming.mp3")

人物出声的话,多听听内置的音色,选择合适的,通过语速、语调、音量,来分段控制,合并。

最后,所有的视频、音乐、语音 TTS。

通过 FFMPEG 进行合并。

小技巧就是,可以留适当的空帧,用空镜头来增加氛围感和节奏感。

Notion image

三、资源最大化策略

策略1:图片批量抽卡

JAVASCRIPT
# 最优:单次n=9
payload = {
    "model""image-01",
    "prompt""疲惫女子,深蓝西装...",
    "n"9,  # 一次9张选最优
    "aspect_ratio""16:9"
}
# 120张额度 = 13次API调用(9×13=117张,余3张)

策略2:角色一致性锁

JAVASCRIPT
# 用subject_reference锁定角色
payload = {
    "model""image-01",
    "prompt""同一个人在地铁站...",
    "subject_reference": [{
        "type""character",
        "image_file""https://catbox.moe/xxx.png"
    }],
    "n"4
}

策略3:视频运镜优化

JAVASCRIPT
# 15种指令免费可用
payload = {
    "model""MiniMax-Hailuo-2.3",
    "first_frame_image""https://catbox.moe/shot.png",
    "prompt""女子走进车厢 [推进,变焦推进], 然后看向窗外 [左摇,上升], 镜头[固定]",
    "duration"6,
    "resolution""768P"
}

15种运镜指令:

  • • 移动:[左移] [右移] [推进] [拉远] [上升] [下降]

  • • 摇镜:[左摇] [右摇] [上摇] [下摇]

  • • 变焦:[变焦推近] [变焦拉远]

  • • 其他:[晃动] [跟随] [固定]

策略4:视频尾帧接续

JAVASCRIPT
image-01生成首帧图 → Hailuo 2.3生成视频
                       ↓
                 FFMPEG 提取尾帧 → 作为下一条首帧

Notion image

最后

最后,讲三个,在我看来是现在做 AI 视频很关键的部分,可以弥补模型的缺陷。

镜头语言,AI 特色,空镜。

其一,镜头语言

前端时间很火的 《纸手机》,给我最大的启发,就是镜头语言。

短篇里,很少有多个人物出现在同一个场景下的画面。

大部分都是近景、人物特色、视线外放。

没错,人物的视线是往外的,看向镜头之外,观众会自动脑部空间,减少 AI 的出错,增加镜头的语言,补充观众的想象,一举三得。

通过对视线、想象、声音、空镜的组合,感官上就会自动推动剧情发展,这是比单独一个画面来演绎更高级、更自然的方式。

其二, AI 特色。

天然适合鬼片。

鬼片就是抽象的,不讲逻辑,存在画面故障的。

我刚才放的片子里,闹钟场景其实就是 AI 的一个废片,但是放到鬼片里,却增加了氛围感。

还有抽象的人物镜头行动方式,夸张的表情,浮夸的动作。

这些在正常片子里一眼假的内容,在鬼片里,是不是就符合逻辑了!

天才!出院!

其三,空镜头。

空镜头,可以理解为黑屏或者纯场景画面。

它对人物一致性的要求很低。

适当的空镜转场,可以调动视频的节奏,增加影片的艺术感。

没有了人物,一个纯场景的视频,它的废片率就大大降低了。

玩 AI ,文科、理科生,一起探索影视制作。

Notion image

原文地址: https://mp.weixin.qq.com/s?__biz=MzA4NzMyNzU5Mg==&mid=2453076844&idx=1&sn=bdaf646001aa3d226529588c538cfba0&chksm=863080a2cc7a0dc39e1da8403ecaf785683a3c2abd60d6f0224a5d77c593b77d73dc4aeb2bc0&mpshare=1&scene=1&srcid=0409OQsHG7tCz8PfP56IiJdS&sharer_shareinfo=ddaea951fc3d78297640ea5683cb2906&sharer_shareinfo_first=ddaea951fc3d78297640ea5683cb2906#rd

相关文章