harry0703 / MoneyPrinterTurbo

harry0703/MoneyPrinterTurbo

open_in_new前往仓库

利用AI大模型和自动化工作流,根据主题或关键词一键生成高清短视频。

项目概览

项目概述

MoneyPrinterTurbo 是一款基于 AI 大模型与自动化工作流的一站式短视频生成工具。用户只需提供视频主题或关键词,即可自动完成脚本撰写、素材匹配、字幕生成、背景音乐合成,最终输出高清短视频。项目支持 WebUI、API、CLI 及 AI Agent 四种使用方式,并支持批量生成与跨平台发布。

核心功能

  • AI 脚本生成:支持多种主流大模型(如 Kimi、OpenAI、Gemini、DeepSeek 等)自动生成视频脚本,也支持自定义脚本。
  • 视频尺寸与批量生成:支持竖屏 9:16(1080x1920)和横屏 16:9(1920x1080),可一次生成多个视频。
  • 语音合成:集成 Edge TTS、Azure Speech、SiliconFlow、Google Gemini、小米 MiMo、ElevenLabs、Chatterbox 等多种 TTS 服务。
  • 字幕生成:支持基于 TTS 时间戳或本地 Whisper 转写生成字幕,可自定义字体、位置、颜色等样式。
  • 素材获取:支持使用本地素材,也可从 Pexels、Pixabay、Coverr 等平台获取免费高清素材。
  • 背景音乐:支持随机或指定背景音乐,并可调节音量。
  • 跨平台发布:生成完成后可自动上传至 TikTok、Instagram、YouTube Shorts。

适用与不适用场景

适用场景:

  • 短视频创作者快速生成内容,如抖音、快手、TikTok 等平台的竖屏视频。
  • 营销人员制作产品宣传或品牌推广视频。
  • 教育工作者制作知识科普或课程短视频。
  • 需要批量生成视频的媒体运营场景。

不适用场景:

  • 需要高度定制化、复杂剪辑或专业特效的视频制作。
  • 对视频内容有严格版权要求,且无法接受自动匹配素材的场景。
  • 完全离线、无网络环境下的视频生成(依赖云端 LLM、TTS 和素材源)。

技术架构与依赖

  • 编程语言:Python 3.11+。
  • 核心依赖:Streamlit(WebUI)、FastAPI(API)、FFmpeg(视频处理)、faster-whisper(字幕转写)、Edge TTS 等。
  • 架构分层:控制器、服务、模型分层设计,支持 AI Agent、WebUI、API、CLI 四种入口。
  • 外部服务:依赖大模型 API(如 OpenAI、Kimi 等)、TTS 服务、素材平台 API(Pexels 等)。

安装与快速开始

前提条件

  • Python 3.11 或更高版本。
  • 建议系统:Windows 10、macOS 11.0+、主流 Linux 发行版。
  • GPU 非必需,但使用 Whisper 或批量生成时建议配备。

快速开始方式

  1. AI Agent:发送 Skill 文档链接,Agent 自动完成安装、配置和生成。
  2. Google Colab:点击 Colab 链接在线体验。
  3. Windows 一键启动包:下载 Releases 中的启动包,解压后运行 update.bat 和 start.bat。
  4. Docker 部署:执行 docker compose -f docker-compose.release.yml up,访问 http://127.0.0.1:8501。
  5. 手动部署:克隆仓库,使用 uv sync --frozen 安装依赖,运行 webui.bat(Windows)或 sh webui.sh(macOS/Linux)启动 WebUI;运行 python main.py 启动 API;运行 python cli.py --video-subject "主题" 使用 CLI。

典型使用方法

通过 CLI 生成视频

uv run python cli.py --video-subject "人工智能如何改变日常生活"

通过 WebUI 生成

启动 WebUI 后,在浏览器中打开 http://127.0.0.1:8501,输入主题或关键词,选择配置(如视频尺寸、语音、字幕等),点击生成。

通过 API 调用

启动 API 服务后,访问 http://127.0.0.1:8080/docs 查看接口文档,通过 HTTP 请求提交生成任务。

通过 AI Agent 生成

将 Skill 文档链接发送给支持终端操作的 AI Agent,Agent 会自动完成安装、配置和生成,最终返回视频文件路径。

配置与部署要点

  • 配置文件:首次启动自动从 config.example.toml 创建 config.toml,可在 WebUI 基础设置中配置大模型 Provider、素材来源和 API Key。
  • 语音合成配置:默认使用 Edge TTS(无需 API Key),其他 TTS 需在 WebUI 中填写对应凭据。
  • 字幕模式:在 config.toml 中设置 subtitle_provider 为 edge(默认)或 whisper,Whisper 模式需下载模型。
  • 跨平台发布:需注册 Upload-Post 并配置 API Key,在 config.toml 中启用 upload_post_enabled 等参数。
  • FFmpeg 问题:若提示找不到 ffmpeg,可手动下载并设置 ffmpeg_path。
  • Docker 部署:推荐使用 docker-compose.release.yml 拉取预构建镜像,首次启动前需复制 config.example.toml 为 config.toml。

限制、风险与许可证

  • 限制:依赖外部 API 和网络,离线无法使用;素材匹配质量受限于素材库;Whisper 模式需要下载较大模型。
  • 风险:自动生成的视频可能涉及版权问题(如背景音乐、素材),需用户自行确认;跨平台发布需遵守各平台规则。
  • 许可证:MIT License(详见仓库 LICENSE 文件)。

官方链接

信息来源和分析时间

  • 信息来源:GitHub 仓库 README、Skill 文档、Release 信息。
  • 分析时间:2026-07-24(基于最新 Release 发布时间)。