PixelleVideo开源AI全自动短视频生成引擎源码
Pixelle-Video 是一套基于 Python 构建的开源 AI 全自动短视频生成引擎源码。它没有停留在单一的大模型调用层面,而是将选题、文案、分镜规划、AI 图片或视频生成、配音、背景音乐与字幕合成串联起来,形成一条完整的视频生产链路。输入一个主题后,用户可以通过 Web 界面完成从脚本到成片的整个流程,也可以基于源码继续扩展成自己的 AI 视频创作平台。
从主题到成片的视频生产链路
在 Pixelle-Video 中,一次完整的短视频创作由用户提供的主题驱动。系统会先调用大语言模型生成视频脚本和解说文案,再对文案内容进行拆分和画面规划,确定每个视频片段的视觉方向。之后通过 AI 图片或视频生成模型产出画面素材,再调用 Edge-TTS、Index-TTS 等语音方案生成旁白,最终把背景音乐、字幕与视觉模板合成到成片中。
这条生产链路并不是固定写死的。脚本生成、画面规划、媒体生成与最终合成通过模块化结构连接,既可以使用整套默认流程,也可以根据项目需要更换其中某个阶段的模型或处理服务。
视频创作核心功能
脚本文案与自动分镜
用户输入主题后,系统先完成文案创作,再由文案内容自动拆分视频片段并规划对应画面。也就是说,从一段想法到具体分镜结构并不完全依靠手工作业,而是由系统先给出一版可编辑方案,创作者再在此基础上调整内容与画面方向。
AI画面生成与扩展创作场景
在基础文字生成短视频之外,项目也扩展到了图生视频、数字人口播、动作迁移、自定义素材和批量视频任务等创作形式。动作迁移允许上传参考视频与图片,让图片内容按照参考视频的动作生成;数字人口播可以结合数字人形象和多语言 TTS,自动完成口播类短视频。
自定义素材功能面向已有照片或视频的用户,AI 会先分析用户上传的内容,再基于这些素材生成脚本和视频,适合将实拍素材快速转化为短视频的场景。系统还支持竖屏、横屏、方形等多种视频尺寸,为不同内容平台提供对应输出。
配音、字幕与最终合成
画面素材准备好后,项目会进入语音合成环节,使用 TTS 方案生成旁白,并将旁白、背景音乐、字幕以及视觉模板组合到输出视频中。用户可以选择不同模板来适配知识科普、情感故事、影视解说、生活记录等不同内容类型。
AI模型接入与ComfyUI工作流编排
项目在模型接入层面没有绑定在一家服务商上。语言模型方面支持 GPT、通义千问、DeepSeek、Ollama 等,画面生成方面可以接入 ComfyUI、RunningHub 以及 DashScope、OpenAI、Seedream、Seedance、Kling 等图像或视频生成服务,实际使用时可以按照不同工作流替换底层模型。
ComfyUI 工作流是 Pixelle-Video 的一个重要扩展点。用户可以直接使用仓库中预设的工作流,也可以根据需求修改或重新设计工作流,更换图片生成模型、视频生成模型或 TTS 模型。这种设计让 Pixelle-Video 更像一个 AI 能力编排平台,而不是只面向单一供应商的演示程序。
项目结构与可扩展目录
从仓库结构来看,Pixelle-Video 已经包含完整的开源项目形态,而不是简单的快速示例。仓库中可以看到 pixelle_video 核心模块、web Web 界面、api 接口相关代码、workflows 工作流目录、templates 视频模板、bgm 背景音乐以及 Windows 打包相关目录。
pixelle_video:核心视频生产逻辑与业务模块;
web:用户操作与任务管理界面;
api:模型接入与对外接口相关代码;
workflows:ComfyUI 视觉生成工作流;
templates:短视频视觉模板;
bgm:背景音乐资源目录;
不同目录分别承担视频生成、任务入口、模型接入和素材管理职责。若要对项目进行二次开发,可以快速找到逻辑修改的位置;若只想替换模板或音乐素材,则只需要关注 templates、bgm 等资源目录。
本地运行环境与启动方式
由于 Pixelle-Video 需要完成文本生成、图像或视频生成、语音合成和最终视频编码,运行环境涉及 Python、uv、FFmpeg 等基础工具。源码安装时需要根据项目说明准备好这些依赖,再继续安装 Python 包并配置对应模型 API 或 ComfyUI 服务。
安装基础运行环境:Python、uv、FFmpeg;
获取源码并安装项目依赖;
按实际使用场景配置大语言模型、图像或视频生成 API 及 ComfyUI 工作流;
启动 Web 界面并创建视频生成任务;
如果是不熟悉 Python 或 uv 的普通用户,可以直接使用项目提供的 Windows 一键整合包,启动后打开 Web 界面即可操作,不需要手动搭建整套开发环境。
适用场景与二次开发方向
Pixelle-Video 的输出能力覆盖多种内容类型,支持竖屏、横屏、方形等不同视频尺寸,适合知识科普、历史文化、情感故事、影视解说、生活记录以及商业内容的批量生产。它不是只做固定模板的小工具,更像是一套可以按实际需要调整短视频生产流程的底层引擎。
从源码价值来看,开发者可以把它用于自动化内容平台、数字人系统或批量视频生成服务。由于项目已经将脚本、画面、配音和视频合成拆分为独立模块,二次开发时可以在某一环节接入自有的模型服务,也可以修改整体输出格式,再将生成能力整合到现有业务系统中。
界面与视频生成效果展示
