WildernessStudioAI Skills AtlasA Flora experiment
跳到正文

适合谁

视频生成:适合评估视频生成技能的流程、工具链和交付场景。

Codex 用法

优先按具体技能或原项目安装方式使用,不建议把归档目录整包复制。

先作为拆解参考;不要直接当 Codex skill 整包安装。

许可证 / 风险

媒体生成项目通常依赖模型和外部服务,部署前核对权利与成本。

Pixelle-Video

AI 驱动的全自动短视频引擎。输入一个主题,自动完成脚本撰写、图像生成、语音合成、BGM 添加和视频合成,输出一段完整视频。

AI 生成 全自动化 开源免费
1
输入
5
处理步骤
3+
语音引擎
3
视频模型

🏗️ 系统流程架构

从输入到输出的完整处理流水线

📝 AI 脚本撰写

基于输入的主题或关键词,AI 自动生成解说文案。支持 GPT、通义��问��DeepSeek、Ollama 等模型。

🎨 AI 图像生成

为每个脚本片段生成对应的插图。支持 ComfyUI (WAN 2.1) 和 RunningHub 平台。

🎬 AI 视频生成

使用 WAN 2.1 或类似模型,将图像转换为视频片段。

🗣️ AI 语音合成

Text-to-Speech 引擎:Edge-TTS、Index-TTS、声音克隆。支持多种音色。

🎵 BGM + 合成

添加背景音乐,整合所有素材,导出最终 MP4 视频。

⚡ 核心功能

完整自动化短视频生产的所有能力

📝智能脚本撰写

输入一个主题关键词,AI 自动完成整个解说文案。也可以自定义脚本,固定内容生成。

🎨AI 图像生成

为每个视频片段生成匹配的插图。风格可配置:竖版/横版/方形。

🎬AI 视频生成

基于 WAN 2.1 模型,静态图转动态视频。也可使用 RunningHub。

🗣️语音合成

Edge-TTS、Index-TTS 免费方案,或定制声音克隆。

🎵背景音乐

内置 BGM 库,也支持自定义上传音频文件。

🧑‍💼数字人

扩展模块:数字人主播、图像转视频、运动迁移。

📱多尺寸输出

竖版 (9:16)、横版 (16:9)、方形 (1:1),适配不同平台。

🔧自定义工作流

基于 ComfyUI 架构,可定制化工作流程。

🧰 工具箱

安装和使用命令

Windows 一键启动

下载 exe → 解压 → 双击 start_web.bat

访问 http://localhost:8501

macOS / Linux 源码

uv pip install -r requirements.txt
uv run streamlit run web/app.py

需要先安装 uv 和 ffmpeg

配置文件

web/config.yaml

配置 LLM API Key、模型选择、生成参数

依赖安装 (macOS)

brew install ffmpeg
curl -LsSf https://astral.sh/uv/install.sh | sh

FFmpeg + uv 环境

LLM 模型选择

支持: GPT / 通义千问 / DeepSeek / Ollama

在界面配置 API Key ��模��

图像服务配置

ComfyUI 本地 / RunningHub API

选择图像生成后端服务

💬 假如 Pixelle-Video 是一个视频团队

它是如何协作完成一个视频的。

做一个科普视频

👤
用户

帮我做一个关于"人工智能历史"的短视频,2分钟。

📝
AI 编剧

收到!自动撰写脚本:从图灵机到 GPT,从规则到深度学习...

🎨
AI 画师

为每个片段生成配图:图灵机、老式电脑、神经网络、GPT 标志...

🎬
AI 动画师

将静态图转为动态:机器转动、电流流动、数据流动...

🗣️
AI 解说

用 Edge-TTS 生成旁白:沉稳男声,中文普通话...

🎵
AI 配乐

添加背景音乐:舒缓的科技感纯音乐...

📹
AI 剪辑

合成所有素材,导出 MP4 完成!

📚 大白话百科

用日常例子解释这些概念

🎬 WAN 2.1 是什么?

就像一个"图像动画师"。你给它一张静态图,它能让图里的人动起来、物体飘起来。就像哈利波特的魔法照片。

🗣️ TTS 是什么?

Text-to-Speech,文字转语音。就像导航软件的语音包,把写好的文案念出来。

🎵 BGM 是什么?

Background Music,背景音乐。视频的氛围担当,舒缓或激昂,AI 自动匹配。

🎨 ComfyUI 是什么?

一个AI图像生成的工作台。就像photoshop的AI插件版,可以搭建各种图像生成工作流。

🧑‍💼 数字人是什么?

AI 生成的虚拟主播。可以用真人照片生成会说话的头像,就像新闻主播一样播报。

🔧 工作流是什么?

一系列处理步骤的组合。脚本→图像→视频→语音→音乐,就像工厂的流水线,每个环节自动衔接。