适合谁
视频生成:适合评估视频生成技能的流程、工具链和交付场景。
适合谁
视频生成:适合评估视频生成技能的流程、工具链和交付场景。
Codex 用法
优先按具体技能或原项目安装方式使用,不建议把归档目录整包复制。
先作为拆解参考;不要直接当 Codex skill 整包安装。
许可证 / 风险
媒体生成项目通常依赖模型和外部服务,部署前核对权利与成本。
AI 驱动的全自动短视频引擎。输入一个主题,自动完成脚本撰写、图像生成、语音合成、BGM 添加和视频合成,输出一段完整视频。
从输入到输出的完整处理流水线
基于输入的主题或关键词,AI 自动生成解说文案。支持 GPT、通义��问��DeepSeek、Ollama 等模型。
为每个脚本片段生成对应的插图。支持 ComfyUI (WAN 2.1) 和 RunningHub 平台。
使用 WAN 2.1 或类似模型,将图像转换为视频片段。
Text-to-Speech 引擎:Edge-TTS、Index-TTS、声音克隆。支持多种音色。
添加背景音乐,整合所有素材,导出最终 MP4 视频。
完整自动化短视频生产的所有能力
输入一个主题关键词,AI 自动完成整个解说文案。也可以自定义脚本,固定内容生成。
为每个视频片段生成匹配的插图。风格可配置:竖版/横版/方形。
基于 WAN 2.1 模型,静态图转动态视频。也可使用 RunningHub。
Edge-TTS、Index-TTS 免费方案,或定制声音克隆。
内置 BGM 库,也支持自定义上传音频文件。
扩展模块:数字人主播、图像转视频、运动迁移。
竖版 (9:16)、横版 (16:9)、方形 (1:1),适配不同平台。
基于 ComfyUI 架构,可定制化工作流程。
安装和使用命令
访问 http://localhost:8501
需要先安装 uv 和 ffmpeg
配置 LLM API Key、模型选择、生成参数
FFmpeg + uv 环境
在界面配置 API Key ��模��
选择图像生成后端服务
它是如何协作完成一个视频的。
用日常例子解释这些概念
就像一个"图像动画师"。你给它一张静态图,它能让图里的人动起来、物体飘起来。就像哈利波特的魔法照片。
Text-to-Speech,文字转语音。就像导航软件的语音包,把写好的文案念出来。
Background Music,背景音乐。视频的氛围担当,舒缓或激昂,AI 自动匹配。
一个AI图像生成的工作台。就像photoshop的AI插件版,可以搭建各种图像生成工作流。
AI 生成的虚拟主播。可以用真人照片生成会说话的头像,就像新闻主播一样播报。
一系列处理步骤的组合。脚本→图像→视频→语音→音乐,就像工厂的流水线,每个环节自动衔接。