PixVerse CLI:在终端生成 AI 视频和图像
安装 PixVerse CLI,在终端生成 AI 视频、图像、语音和音乐,并通过 JSON 输出自动化智能体工作流。
简介
每个创意工作流都有一个瓶颈:当你不得不离开代码编辑器、打开浏览器,并在 Web 界面中手动点击来生成媒体内容。对于开发者、AI 智能体,以及任何构建自动化内容管道的人来说,这种上下文切换都会迅速累积摩擦。
PixVerse CLI 消除了这个瓶颈。它是 PixVerse 官方命令行界面,让你可以直接从终端访问 PixVerse 生成和工作区工作流。文生视频、图生视频、文生图、图生图、转场、语音生成、音乐生成、参考视频、动作控制、模板、超分放大和资产管理都可以脚本化、管道化,无需打开浏览器。如需最快的安装路径和智能体设置概览,请从 PixVerse CLI 官方页面 开始。
PixVerse CLI 的特别之处在于它面向 AI 智能体设计。命令可以通过 --json 或 -p 返回结构化 JSON,退出码是确定的,每个管道步骤都可以组合。这意味着你可以让 Claude Code、Cursor、Codex 或其他智能体代你生成图像、视频、语音和音乐,同时减少脆弱的手动交接。
本指南与 2026 年 7 月 13 日检查的当前 PixVerseAI/cli GitHub README、公共 能力清单 和 PixVerse CLI 产品页面保持一致。PixVerse CLI 会通过 GitHub 仓库持续更新,因此生产脚本仍应在大批量运行之前验证 pixverse --version、pixverse create <mode> --help 和 pixverse update。
先决条件
在开始之前,您需要:
- Node.js 20 或更高版本 — 使用
node --version检查 - PixVerse 账号 — 在 pixverse.ai 注册
- 有效的 PixVerse 订阅 — CLI 使用与网站相同的积分系统;只有订阅用户才能生成内容
PixVerse CLI 不需要手动复制任何 API 密钥。身份验证是通过基于浏览器的 OAuth 流程处理的,该流程在本地存储您的令牌。
第 1 步:安装 CLI
使用 npm 进行全局安装:
验证安装:
如果您不想全局安装,也可以通过 npx 运行命令:
第 2 步:认证
运行登录命令:
CLI 打开浏览器以进行 OAuth 设备授权。您还可以复制 URL 并从任何设备上的任何浏览器完成授权,这对于 SSH 和无头环境非常有用。您的令牌会自动存储在 ~/.pixverse/ 中,有效期为 30 天。
要验证您是否已登录并检查您的可用积分:
account info 命令显示您的订阅档位、工作区积分和使用上下文。 pixverse account usage 帮助您查看积分消耗,而 pixverse account slots 显示图像和视频作业的当前并发生成 slots。 CLI 会话独立于 PixVerse Web/应用程序会话,您可以使用 pixverse auth logout 删除存储的 CLI 令牌。在运行批处理作业之前,请务必检查您的余额和可用 slots。
快速启动命令
如果您只需要从安装到生成的资产的最短路径,请按以下顺序开始:
npm install -g pixverse
pixverse auth login
pixverse create image --prompt "A photorealistic forest path at golden hour" --json
pixverse create video --prompt "A sunset over ocean waves" --model v6 --quality 720p --duration 5 --json
对于 AI 智能体和 CI 工作流,请保持 --json 或 -p 启用,以便 stdout 保持机器可读,同时进度和错误保留在 stderr 上。对于生产重试,请将 --idempotency-key <key> 添加到创建命令中,以便重复提交不会意外创建重复扣费的任务。
第 3 步:生成第一张图像
文本到图像生成是测试设置的最快方法。运行:
当前 GitHub README 将 GPT Image 2 列为默认图像模型。对于可重复的自动化,仍然显式设置 --model 并在批量工作之前检查实时 CLI 帮助或 capabilities.json。 --json 标志返回结构化输出:
对于更高分辨率的输出,请指定支持它的模型:
PixVerse 支持多种图像模型,每种模型都有不同的分辨率上限和宽高比支持:
| 模型 | --model 值 |
画质 | 说明 |
|---|---|---|---|
| GPT Image 2 | gpt-image-2.0 |
1080p、1440p、2160p | 默认图像模型;支持宽和高的纵横比 |
| Nano Banana 2 | gemini-3.1-flash |
512p、1080p、1440p、2160p | 灵活的 auto 和标准纵横比 |
| Nano Banana 2 Lite | gemini-3.1-flash-lite |
1080p | 面向快速图像工作流的轻量级 Nano Banana 2 选项 |
| Qwen Image | qwen-image |
720p、1080p | 快速生成常见的创意任务 |
| Nano Banana Pro | gemini-3.0 |
1080p、1440p、2160p | 以较大尺寸创建高质量图像 |
| Nano Banana | gemini-2.5-flash |
1080p | 轻量级图像生成,周转速度快 |
| Seedream 5.0 Pro | seedream-5.0-pro |
1080p、1440p | 支持标准纵横比和多参考图像工作流 |
| Seedream 5.0 Lite | seedream-5.0-lite |
1440p、1800p、2160p | 高细节创意图像 |
| Seedream 4.5 | seedream-4.5 |
1440p、2160p | 高分辨率图像生成 |
| Seedream 4.0 | seedream-4.0 |
1080p、1440p、2160p | 用于图像工作流的附加 Seedream 选项 |
| Kling Image O3 | kling-image-o3 |
1080p、1440p、2160p | 具有灵活框架的风格化视觉输出 |
| Kling Image V3 | kling-image-v3 |
1080p、1440p | 平衡的质量和速度 |
您还可以使用图像到图像转换现有图像:
下载生成的图像:
第 4 步:生成您的第一个视频
文本转视频的工作原理相同。生成 5 秒剪辑:
对于完全定制的一代:
--audio 标志可启用 AI 生成的与您的视频内容相匹配的环境声音。 --json 标志在完成时返回 video_url,您可以将其直接传递到下载命令或管道中的下一步。
PixVerse提供多种不同质量、时长、模式支持的视频模型:
| 模型 | --model 值 |
最高画质 | 时长 | 说明 |
|---|---|---|---|---|
| PixVerse V6 | v6 |
1080p | 1–15 秒 | 默认视频模型;广泛的纵横比支持 |
| PixVerse C1 | pixverse-c1 |
1080p | 1–15 秒 | 跨视频、参考和过渡工作流的强大支持 |
| Seedance 2.0 Standard | seedance-2.0-standard |
2160p | 4–15 秒 | 支持视频、参考和过渡模式 |
| Seedance 2.0 Fast | seedance-2.0-fast |
720p | 4–15 秒 | 适用于视频、参考和过渡模式的更快 Seedance 选项 |
| Seedance 2.0 Mini | seedance-2.0-mini |
720p | 4–15 秒 | 用于视频、参考和过渡模式的轻量级 Seedance 选项 |
| Google Gemini Omni | gemini-omni-flash |
720p | 3–10 秒 | 支持 16:9 或 9:16 的视频和参考工作流 |
| Happy Horse 1.0 | happyhorse-1.0 |
1080p | 3–15 秒 | create video 提供音频感知视频选项 |
| Kling O3 Pro | kling-o3-pro |
720p | 3–15 秒 | 支持视频、参考和过渡工作流 |
| Kling O3 Standard | kling-o3-standard |
720p | 3–15 秒 | 标准 Kling O3 选项 |
| Kling 3.0 Pro | kling-3.0-pro |
720p | 3–15 秒 | 支持视频和过渡工作流 |
| Kling 3.0 Standard | kling-3.0-standard |
720p | 3–15 秒 | 标准 Kling 3.0 选项 |
| Grok Imagine 1.5 | grok-imagine-1.5 |
720p | 1–15 秒 | 仅图像到视频;需要 --image 并遵循输入图像的长宽比 |
| Grok Imagine | grok-imagine |
720p | 1–15 秒 | 早期的 Grok 选项;支持视频、扩展和参考工作流 |
| Veo 3.1 Lite | veo-3.1-lite |
1080p | 4、6 或 8 秒 | 支持视频和 2 帧过渡工作流 |
| Veo 3.1 Standard | veo-3.1-standard |
2160p | 4、6 或 8 秒 | 更高分辨率的 Veo 选项 |
| Veo 3.1 Fast | veo-3.1-fast |
2160p | 4、6 或 8 秒 | 更快的 Veo 选项 |
| Sora 2 Pro | sora-2-pro |
1080p | 4、8 或 12 秒 | 固定期限 Sora 选项 |
| Sora 2 | sora-2 |
720p | 4、8 或 12 秒 | 标准索拉选项 |
| PixVerse v5.6 | v5.6 |
1080p | 1–10 秒 | 仍用于运动控制和选定的生成工作流 |
| PixVerse v5.5 | v5.5 |
1080p | 1–10 秒 | 用于 create modify 工作流 |
| PixVerse v5 | v5 |
1080p | 1–10 秒 | 用于 3+ 帧过渡工作流 |
将静态图像动画化
要将照片或生成的图像转换为视频,请提供 --image 标志:
您可以传递本地文件路径或 URL。本地文件会自动上传 - 无需手动上传步骤。大于1920x1920或5MB的本地图片输入在上传前会自动调整大小或压缩;远程图像 URL 由后端按原样验证。
对于 Grok Imagine 1.5,需要一个图像,并且输出宽高比遵循该图像:
使用参考、过渡、运动控制和模板
当前的CLI支持的不仅仅是简单的文本转视频和图像转视频。当您需要对角色、关键帧、编辑或效果进行更多控制时,这些创建模式非常有用:
并非每个模型都支持所有创建模式。当前 README 矩阵中,create video 支持 v6、pixverse-c1、Seedance 2.0 Standard/Fast/Mini、Google Gemini Omni、Happy Horse 1.0、Kling O3、Kling 3.0、Grok Imagine、Veo 3.1、Sora 2 和 v5.6。grok-imagine-1.5 仅图像转视频,需要 --image;create extend 支持 v6 和 grok-imagine;create reference 支持 v6、pixverse-c1、Seedance 2.0 Standard/Fast/Mini、Google Gemini Omni、Kling O3、grok-imagine 和 v5.6;2 帧过渡支持较新的视频系列;3+ 帧过渡使用 v5;create modify 使用 v5.5;而 create motion-control 使用 v5.6。
第 5 步:生成语音和音乐
当前的 GitHub README 通过专用创建命令记录独立音频。使用 create voice 进行文本转语音,使用 create music 生成提示音乐。语音和音乐输出保存为音频资产,因此您可以使用 task 跟踪它们,使用 asset list --type audio 列出它们,并使用 asset download --type audio 下载它们。对于本机视频氛围,请在支持的视频创建命令上使用 --audio 或 --no-audio。
生成语音音频:
浏览语音模型和预设语音:
生成音乐:
对于纯音乐曲目,请使用 --instrumental。对于支持歌词的模型,将歌词作为字面文本、本地文件路径或stdin传递:
目前的语音模型系列包括 MiniMax Speech 2.8 和 ElevenLabs 模型。当前音乐模型系列包括 MiniMax Music、ElevenLabs Music 和 Google Lyria 3 Pro。在编写生产脚本前,请使用 pixverse voice models 和 pixverse music models 查看实时目录。
第 6 步:运行交互式向导
如果您是第一次探索并且还不熟悉所有可用标志,请运行任何不带参数的创建命令以进入引导向导:
该向导将逐步引导您完成提示、模型选择、质量、纵横比、时长和其他选项,这对于在编写脚本之前发现可用参数非常有用。
超越一代:管理您的资产和工作空间
当前 PixVerse CLI 还包含一组管理命令,可帮助你构建端到端终端工作流:
pixverse task status <id>和pixverse task wait <id>用于任务轮询pixverse task status --ids 123,456,789 --type video --json用于批次状态检查pixverse asset list、asset upload、asset info、asset download和asset delete用于视频、图像和音频资产生命周期操作- 用于已保存文件夹的
pixverse saved list、saved items、saved new、saved rename、saved add、saved remove和saved delete pixverse template categories、template list、template search和template info用于发现效果和模板- 用于实时音频模型发现的
pixverse voice models、voice presets和music models pixverse workspace list、workspace status、workspace switch和workspace manage用于多工作空间操作pixverse account info、account usage和account slots用于积分、使用情况和并发检查pixverse config set、config list、config path和config defaults用于可重复的本地默认值
这使得在一个脚本中不仅可以轻松实现创建自动化,还可以实现组织、模板发现、音频发现、下载、工作区路由和交付的自动化。如果您需要针对不同的工作区运行一个命令,请使用全局 --workspace-id <id> 标志; 0 针对您的个人工作空间。
脚本友好标志
大多数自动化依赖于可预测的输出和可预测的运行时行为。这些标志在脚本和 AI 智能体工作流中特别有用:
| 旗帜 | 用它来 |
|---|---|
--json |
返回结构化 JSON 输出 |
-p |
--json 的短别名 |
--count <n> |
根据一个请求生成 1-4 个变体 |
--seed <number> |
让一代人更容易繁衍 |
--off-peak |
如果可用,请使用非高峰定价 |
--audio / --no-audio |
在支持的创建命令上启用或禁用音频生成 |
--multi-shot / --no-multi-shot |
启用或禁用视频的连拍模式 |
--no-wait |
提交作业并立即返回 |
--timeout <sec> |
设置轮询超时时间,默认300秒 |
--workspace-id <id> |
覆盖单个命令的活动工作区 |
--trace-id <uuid> |
将调用者提供的 UUIDv4 附加到 API 请求以进行调试和可观察 |
--idempotency-key <key> |
安全地重试创建请求,而不会意外创建重复扣费的任务 |
文本输入标志现在更容易自动化。 --prompt、--text 和 --lyrics 可以接受文字字符串、本地文件路径或stdin的 -:
教您的 AI 代理生成媒体
对于希望先使用应用内引导式工作流、再转向命令行自动化的团队,PixVerse Agent 在 PixVerse 应用中提供了面向智能体的创作工作流。
这就是 PixVerse CLI 真正变革的地方。由于命令可以返回结构化的 JSON 并使用确定性退出代码,因此可以教会任何可以运行 shell 命令的 AI 代理按需生成图像和视频。
安装PixVerse Skills
PixVerse Skills是一个结构化技能库,可教导代理如何正确使用 CLI:命令标志、模型约束、多步骤管道和强大的错误处理。
对于Claude Code等支持技能格式的坐席,直接添加PixVerse技能:
对于 Cursor、Claude Code、Codex 和其他代理框架,此技能通过为代理提供显式约束而不是强制其从头开始推断来提高可靠性。
PixVerse CLI 还在 dist/capabilities.json 上提供了一个紧凑的机器可读命令清单,公共源在 GitHub 存储库中以 capabilities.json 形式提供。该清单描述了命令、标志、退出代码、JSON 输出期望和效果类别,因此代理可以检查 CLI 合约,而无需抓取帮助文本。
一旦您的代理加载了 PixVerse 技能,您就可以向其提供自然语言指令,例如:
- “根据此屏幕截图生成 10 秒的产品演示视频”
- “以 16:9 格式创建此博客封面图片的四种变体”
- “将此图动画化为带有环境声音的 5 秒解释剪辑”
- “使用不同的摄像机动作生成三个 8 秒 16:9 宣传片断”
代理会将这些指令转换为正确的 CLI 命令,解析 JSON 输出,并处理轮询和下载 - 无需手动干预。
Claude Code
在Claude Code中,PixVerse CLI成为代理自主使用的本机工具。加载PixVerse技能后,您可以将媒体生成直接包含在任何任务中:
Claude Code 将调用正确的 CLI 命令,解析 JSON 响应中的图像 URL,并将文件下载到您指定的路径 - 所有这些都在同一会话中编写您的代码。
典型的 Claude Code 工作流:
Cursor
Cursor 用户可以将 PixVerse Skills 作为项目上下文文件加载。将相关技能文件放置在您的 .cursor/ 目录中或将它们添加到您的工作区规则中。加载后,Cursor 可以完全了解每个 PixVerse CLI 命令,并可以生成媒体作为任何编码任务的一部分。
常见的 Cursor 工作流:要求智能体根据你正在构建的设计生成 mockup 图像,然后直接在 IDE 会话中将其用作参考 - 无需离开编辑器。
Codex及其他代理商
PixVerse CLI 与任何可以执行 shell 命令并解析 JSON 的代理兼容。结构化输出格式(一致的字段名称、可预测的错误代码和 stderr 分隔的错误消息)确保即使是简单的脚本代理也可以可靠地集成生成。
退出代码契约使错误处理变得简单:
| 代码 | 含义 | 代理行动 |
|---|---|---|
| 0 | 成功 | 解析 JSON 输出 |
| 1 | 一般错误 | 检查 stderr 并使用经过验证的输入重试 |
| 2 | 超时 | 使用更长的 --timeout 重试 |
| 3 | 授权已过期 | 重新运行pixverse auth login |
| 4 | 积分用完 | 检查余额,通知用户 |
| 5 | 生成失败 | 尝试不同的参数 |
| 6 | 验证错误 | 检查标志值 |
自动化流水线
一旦您理解了各个命令,PixVerse CLI 就会解锁强大的多步骤工作流,完全无需用户交互即可运行。
文本到图像到视频
最有用的管道之一:根据文本提示生成高分辨率图像,然后将其动画化为视频。
完整的视频制作流程
对于抛光输出,通过后处理步骤创建链。当您希望在受支持的视频创建命令上使用本机声音时,请使用 --audio 或 --no-audio,然后将 create voice 用于文本转语音音频,将 create music 用于将在下游组合的独立音乐资产:
批量生成
对于需要多种变体的内容管道,请并行运行作业:
--no-wait 标志提交作业并立即返回任务 ID,允许您在轮询之前提交多个作业。使用 --no-wait --json,记录返回的任务 ID 和解析的创建参数,以进行日志记录和再现性。当您想要从一个提示中获得多种变化时,请使用 --count <n>;当您想要对多个正在运行的作业进行一种状态响应时,请使用批处理 task status --ids。 pixverse task wait 命令为您处理自适应轮询。
配置默认值
如果您始终使用相同的模型、质量或纵横比,请将它们设置为默认值,这样您就不必每次都重复标记:
命令行标志始终覆盖您配置的默认值,因此您可以保留充分的灵活性,同时减少重复。对于特定于工作区的自动化,当您想要覆盖该单次运行的活动工作区时,请将 --workspace-id <id> 添加到命令中。
您可以构建什么
通过将 PixVerse CLI 集成到您的AI 智能体工作流中,可自动化任务的范围显着扩展:
- 文档— 自动生成产品演示视频和屏幕截图作为文档构建过程的一部分
- 营销— 每晚运行批处理作业,从单个提示库生成社交媒体内容变体
- 应用程序开发— 让您的编码代理在构建 UI 时生成占位符视觉效果、模型动画或加载屏幕视频
- 音频工作流— 生成配音草稿、提示音乐曲目或音频资产以供以后编辑
- 内容管道— 将 CLI 调用与其他工具(ffmpeg、ImageMagick、云存储)链接起来,以构建完全自动化的媒体制作工作流
- 原型制作— 在几秒钟内生成快速运动概念,以在投入全面生产之前验证想法
CLI 的设计自然适合任何基于 shell 的工作流。如果您现有的自动化在 bash、Python、Node 或 CI/CD 管道中运行,则 PixVerse CLI 无需任何额外的集成开销即可插入。
入门清单
- 安装 Node.js 20 或更高版本
- 运行
npm install -g pixverse - 运行
pixverse auth login并在浏览器中授权 - 运行
pixverse account info来验证积分 - 在并发批处理工作之前运行
pixverse account slots - 生成您的第一张图像:
pixverse create image --prompt "..." --json - 生成您的第一个视频:
pixverse create video --prompt "..." --json - 生成您的第一个语音资产:
pixverse create voice --text "..." --json - 生成您的第一个音乐资产:
pixverse create music --prompt "..." --json - 使用
pixverse template list探索模板 - 为您的代理安装 PixVerse Skills(Claude Code、Cursor 或 Codex)
- 使用
pixverse config defaults set设置您的首选默认值 - 构建您的第一个自动化管道
使 CLI 保持最新状态
使用内置更新程序使本地 CLI 保持最新:
你也可以直接使用npm:
PixVerse CLI 是一个持续更新的工具,而不是一次性发布内容,因此请把本文视为实用指南,把官方来源视为实时参考层。PixVerse CLI 官方页面 是最短的安装和智能体入门路径,而 GitHub 仍然用于跟踪版本级变更和新支持的模型:
当前文档将 PixVerse V6 列为默认视频模型,将 GPT Image 2 列为默认图像模型,并强调 Google Gemini Omni 视频支持、Nano Banana 2 Lite 和 Seedream 5.0 Pro 图像支持、Seedance 2.0 Mini 支持、按模式区分的 PixVerse v5/v5.5 工作流、专用 create voice 和 create music 命令、音频资产管理、已保存文件夹、工作区切换、config defaults、面向智能体的 capabilities.json、pixverse update、文本输入的 stdin 支持,以及用于更安全重试的 --trace-id 和 --idempotency-key。
下一步
PixVerse CLI 官方页面、GitHub 上的 PixVerse CLI 和 npm (npm install -g pixverse) 使您可以从单个界面立即访问生成、任务轮询、资产管理、模板、已保存文件夹、账号检查、音频模型发现和工作区控制。PixVerse Skills 存储库 添加了面向智能体指导,因此 Claude Code、Cursor、Codex 和其他工具可以更可靠地运行这些工作流。
可靠的 CLI 和面向智能体技能库的结合意味着图像、视频、语音和音乐生成可以与您的代码处于相同的工作流中 — 由同一智能体在同一终端中管理,无需切换工具。
从单个命令开始。从那里开始构建。