## 项目概述

MoneyPrinterTurbo 是一款基于 AI 大模型与自动化工作流的一站式短视频生成工具。用户只需提供视频主题或关键词，即可自动完成脚本撰写、素材匹配、字幕生成、背景音乐合成，最终输出高清短视频。项目支持 WebUI、API、CLI 及 AI Agent 四种使用方式，并支持批量生成与跨平台发布。

## 核心功能

- **AI 脚本生成**：支持多种主流大模型（如 Kimi、OpenAI、Gemini、DeepSeek 等）自动生成视频脚本，也支持自定义脚本。
- **视频尺寸与批量生成**：支持竖屏 9:16（1080x1920）和横屏 16:9（1920x1080），可一次生成多个视频。
- **语音合成**：集成 Edge TTS、Azure Speech、SiliconFlow、Google Gemini、小米 MiMo、ElevenLabs、Chatterbox 等多种 TTS 服务。
- **字幕生成**：支持基于 TTS 时间戳或本地 Whisper 转写生成字幕，可自定义字体、位置、颜色等样式。
- **素材获取**：支持使用本地素材，也可从 Pexels、Pixabay、Coverr 等平台获取免费高清素材。
- **背景音乐**：支持随机或指定背景音乐，并可调节音量。
- **跨平台发布**：生成完成后可自动上传至 TikTok、Instagram、YouTube Shorts。

## 适用与不适用场景

**适用场景**：
- 短视频创作者快速生成内容，如抖音、快手、TikTok 等平台的竖屏视频。
- 营销人员制作产品宣传或品牌推广视频。
- 教育工作者制作知识科普或课程短视频。
- 需要批量生成视频的媒体运营场景。

**不适用场景**：
- 需要高度定制化、复杂剪辑或专业特效的视频制作。
- 对视频内容有严格版权要求，且无法接受自动匹配素材的场景。
- 完全离线、无网络环境下的视频生成（依赖云端 LLM、TTS 和素材源）。

## 技术架构与依赖

- **编程语言**：Python 3.11+。
- **核心依赖**：Streamlit（WebUI）、FastAPI（API）、FFmpeg（视频处理）、faster-whisper（字幕转写）、Edge TTS 等。
- **架构分层**：控制器、服务、模型分层设计，支持 AI Agent、WebUI、API、CLI 四种入口。
- **外部服务**：依赖大模型 API（如 OpenAI、Kimi 等）、TTS 服务、素材平台 API（Pexels 等）。

## 安装与快速开始

### 前提条件
- Python 3.11 或更高版本。
- 建议系统：Windows 10、macOS 11.0+、主流 Linux 发行版。
- GPU 非必需，但使用 Whisper 或批量生成时建议配备。

### 快速开始方式
1. **AI Agent**：发送 Skill 文档链接，Agent 自动完成安装、配置和生成。
2. **Google Colab**：点击 Colab 链接在线体验。
3. **Windows 一键启动包**：下载 Releases 中的启动包，解压后运行 `update.bat` 和 `start.bat`。
4. **Docker 部署**：执行 `docker compose -f docker-compose.release.yml up`，访问 `http://127.0.0.1:8501`。
5. **手动部署**：克隆仓库，使用 `uv sync --frozen` 安装依赖，运行 `webui.bat`（Windows）或 `sh webui.sh`（macOS/Linux）启动 WebUI；运行 `python main.py` 启动 API；运行 `python cli.py --video-subject "主题"` 使用 CLI。

## 典型使用方法

### 通过 CLI 生成视频
```shell
uv run python cli.py --video-subject "人工智能如何改变日常生活"
```

### 通过 WebUI 生成
启动 WebUI 后，在浏览器中打开 `http://127.0.0.1:8501`，输入主题或关键词，选择配置（如视频尺寸、语音、字幕等），点击生成。

### 通过 API 调用
启动 API 服务后，访问 `http://127.0.0.1:8080/docs` 查看接口文档，通过 HTTP 请求提交生成任务。

### 通过 AI Agent 生成
将 Skill 文档链接发送给支持终端操作的 AI Agent，Agent 会自动完成安装、配置和生成，最终返回视频文件路径。

## 配置与部署要点

- **配置文件**：首次启动自动从 `config.example.toml` 创建 `config.toml`，可在 WebUI 基础设置中配置大模型 Provider、素材来源和 API Key。
- **语音合成配置**：默认使用 Edge TTS（无需 API Key），其他 TTS 需在 WebUI 中填写对应凭据。
- **字幕模式**：在 `config.toml` 中设置 `subtitle_provider` 为 `edge`（默认）或 `whisper`，Whisper 模式需下载模型。
- **跨平台发布**：需注册 Upload-Post 并配置 API Key，在 `config.toml` 中启用 `upload_post_enabled` 等参数。
- **FFmpeg 问题**：若提示找不到 ffmpeg，可手动下载并设置 `ffmpeg_path`。
- **Docker 部署**：推荐使用 `docker-compose.release.yml` 拉取预构建镜像，首次启动前需复制 `config.example.toml` 为 `config.toml`。

## 限制、风险与许可证

- **限制**：依赖外部 API 和网络，离线无法使用；素材匹配质量受限于素材库；Whisper 模式需要下载较大模型。
- **风险**：自动生成的视频可能涉及版权问题（如背景音乐、素材），需用户自行确认；跨平台发布需遵守各平台规则。
- **许可证**：MIT License（详见仓库 LICENSE 文件）。

## 官方链接

- GitHub 仓库：https://github.com/harry0703/MoneyPrinterTurbo
- 最新 Release：https://github.com/harry0703/MoneyPrinterTurbo/releases/latest
- 问题反馈：https://github.com/harry0703/MoneyPrinterTurbo/issues

## 信息来源和分析时间

- 信息来源：GitHub 仓库 README、Skill 文档、Release 信息。
- 分析时间：2026-07-24（基于最新 Release 发布时间）。