欢迎光临
我们一直在努力

短视频工厂:把一条短视频的生产线,装进一个桌面 App

项目地址:github.com/YILS-LIN/short-video-factory · AGPL-3.0 开源 · 5.2k Stars · 写于 2026 年 9 月
开源项目AI 视频桌面端批量剪辑

一句话结论:短视频工厂是一个开源的 Electron 桌面应用,输入一句提示词和一批视频素材,它自动跑完文案生成 → 配音 → 混剪 → 字幕 → 合成,产出可发布的竖版短视频。文案走 OpenAI 兼容接口,配音用免费本地的 EdgeTTS,剪辑渲染全部在你自己电脑上完成。5.2k Stars,Windows / macOS / Linux 三端安装包开箱即用。

一、做一条短视频,到底要过多少道工序

外行看短视频,觉得不就是”拍一段发出去”?真正自己动手做过一轮的人才知道,一条两分钟的产品介绍视频背后,其实是一整条看不见的流水线:先想选题、定切入角度,再写口播文案,写完还得反复改断句让它适合念出来;然后找配音,要么自己录到嗓子哑,要么花钱找人;接着找素材,产品图、空镜、实拍片段翻遍素材库;再进剪辑软件对时间轴、卡节奏;最后上字幕、配 BGM、导出、检查、重传。每一道工序都对应一个软件,而软件和软件之间互相不认识,中间全靠人手动搬运文件。

如果只做一条,咬咬牙也就过去了。真正压垮人的是批量这个场景——做电商的每天要发几十条产品视频,做自媒体矩阵的恨不得一天更二十条,做知识付费的要给同一门课剪出十几个不同角度的引流切片。这种量级下,手工流程的每一分钟都被放大几十倍:光是”把文案复制进配音工具、导出音频、再拖进剪辑软件”这一串动作,重复二十次就足以让人放弃更新。更麻烦的是质量不稳定,人一疲劳,第二十条片的字幕错别字和第三条的节奏感完全不是一个水平。

小黑推着一辆堆满六个箱子的独轮车,箱子分别代表选题、文案、配音、素材、剪辑、字幕
选题、文案、配音、素材、剪辑、字幕——一个人推着六个箱子,轮子都要掉了

市面上的解法大致走两条路:一是云端 SaaS 一键生成,省心但素材要上传、按月付费、风格还容易撞车;二是各种单点的 AI 小工具,各管一段,最后拼接的活儿还是落回人身上。短视频工厂想做的是第三条路——把这条流水线整体塞进一台装在你自己电脑里的机器,人只负责喂原料,不负责搬运。它不生成画面,也不替你想创意,它只是把那些机械、重复、不需要判断力的环节全部接管,让你把注意力收回到选题和素材这两件真正决定成败的事上。

二、它的干活方式:一句话进,一条片出

抛开界面细节,它的核心工作流可以压缩成三个动作:你给它一句提示词和一批素材,它把中间的文案、配音、混剪、字幕、合成全部自己跑完,然后还你一条可以直接发布的成片。整个过程不需要在多个软件之间来回切窗口,也没有”从 A 软件导出、再拖进 B 软件”这种损耗。对用过传统剪辑流程的人来说,光是省掉来回搬运素材这件事,就已经值回票价了。

① 给提示词写清产品/主题,AI 生成口播文案
② 丢素材把视频素材丢进素材池,选好配音音色
③ 等出片文案、配音、混剪、字幕自动合成
小黑把写着提示词的纸塞进机器,机器经过文案、声音、画面三个舱室,另一端吐出胶片
中间的文案、配音、画面自己跑,人只要等胶片滑出来

中间那几个”舱室”才是真正见功力的地方。把每个环节拆开看,你会发现作者在很多地方都做了明确的取舍——有的环节选择把控制权交还给用户,有的环节则直接替你把成本砍到零。下面这四项,基本决定了它到底好不好用:

  • 文案生成:兼容通用的 OpenAI 接口格式。这意味着你接 OpenAI、DeepSeek、通义、Kimi、智谱,或者本机跑的 Ollama,只要接口格式对得上就能直接用——模型的选择权和账单都在你手里,不被绑死在某一家的 API 上。这一点比很多”内置模型、只能用它那一个”的同类工具厚道得多,也意味着国内用户不用折腾网络就能跑通整条链路。
  • 语音合成:内置 EdgeTTS,微软家的神经网络音色,免费、本地调用、不用注册任何服务。中文音色在免费方案里属于第一梯队,停顿和轻重音的处理做口播视频完全够用。对刚起步的个人创作者来说,光这一项就把”配音”这道工序的成本直接归零了。
  • 自动混剪:把你的素材池按文案节奏自动切片、排列、合成。它理解的是”文案念到哪一句,画面该配哪一段”,而不是机械地按顺序平铺。同一批素材跑两次,出来的片也不重样,这正是矩阵分发最需要的特性。
  • 字幕:按语音自动对轴上字幕。今年 9 月刚重写了字幕渲染引擎,支持基于真实字体度量的自适应排版、智能分词、自动换行和字号收缩,长文案和中英混排不容易溢出画面。别小看这一项,字幕溢出和错轴是手工剪辑里最耗神的收尾环节。
小黑把文字推进大喇叭,喇叭吐出声波并录进音轨,挂着划掉的价签
文案变语音走的是本地 EdgeTTS,免费,不用另花钱

三、批量模式才是它真正的杀器

单条生成只能算及格线,让我觉得”工厂”这名字没白起的,是它的批量任务模式。你可以先调好一套预设——文案提示词模板、配音音色、素材池范围、字幕样式、输出分辨率——然后让它按这套配置持续合成,一条接一条往下出片,全程不需要人守在旁边点下一步。任务进度和状态都存在本地数据库里,中途关掉软件,下次打开还能接着看。

小黑按住机器拉杆,机器不断吐出视频卡片,小黑手里已经摞了厚厚一叠
按下就跑,一直接,最后来收就行

再看它和”素材池混剪”的配合,批量的价值就被放大了一层:同一个产品,换几种文案切入角度、丢进不同的素材组合,机器能洗出一批彼此都不重样的视频。做矩阵分发或者投放测试的人应该立刻明白这意味着什么——你终于可以低成本地生产”系列”,而不是把同一条片复制二十遍。这在平台查重越来越严的今天,几乎是从”能不能发”到”能不能起量”的分界线。过去这套玩法要么靠堆人力,要么靠买昂贵的云端批量服务,现在一台普通台式机加一个开源软件就能跑起来。

小黑坐在素材卡片堆里洗牌,脚边已经拼好一条胶片带
素材是牌,洗一遍拼一条,每条都不一样

四、拆一下技术栈:全是靠谱的老熟人

作为习惯了先看技术选型再决定要不要往自己电脑上装的人,我照例拆开看了一眼。结论是让人放心的:这个项目没有追任何时髦的新框架,没有为了”AI 感”硬塞些用不上的花活,也没有把一堆重型依赖堆在一起。每一个组件都能说清楚”为什么必须存在”,选型相当务实:

组件 干什么用的 点评
Electron + Vite + TS 桌面壳与前端 TypeScript 全量覆盖,工程化做得规整
better-sqlite3 本地任务/素材数据库 任务状态、批量队列都存在本地库里,断电不丢
ffmpeg-static 内嵌的 ffmpeg 用户不用自己装 ffmpeg,开箱即用的关键
EdgeTTS 语音合成 免费神经网络音色,作者还在持续修它的稳定性
pixi.js 字幕/特效渲染 用游戏渲染引擎做字幕排版,怪但有效
i18next 多语言 中英双语,连更新日志都按语言分发

两个细节值得单独点名。第一,ffmpeg 是内嵌的——Windows 版直接打包进安装包,macOS 版也已完成嵌入,用户不需要配任何环境变量,更不会遇到”命令找不到”这种劝退级报错。在 Electron 视频工具这个品类里,这一点就是及格线和优秀线的分水岭。第二,作者更新非常勤,我写这篇的当天(9 月 3 日)仓库还有新提交,版本已经迭代到 v1.2.2,路线图上”更多语音合成 API”和”更全的参数调整”都在推进中。对于一个刚开源不久的個人项目,这种维护密度比 Star 数更能说明它还活着。

五、怎么装:下安装包就行

首先要明确一点:它不是那种要你配 Python 环境、装一堆依赖、对着命令行敲半天的脚本合集,而是一个正经打包好的桌面应用。去 GitHub Releases 页面,按自己的系统下载对应安装包即可,三个平台都提供了构建产物:

short-video-factory-1.2.2-win-x64-setup.exe          # Windows
short-video-factory-1.2.2-mac-universal-installer.dmg # macOS(Universal)
short-video-factory-1.2.2-linux-x86_64.AppImage       # Linux

装完启动,第一次使用只需要配一样东西:一个 OpenAI 兼容的文案接口,填上 base URL、API key 和模型名就行。配音走内置 EdgeTTS,不用注册任何第三方服务,也不用额外掏钱。中文用户建议先照着官方文档走一遍示例流程熟悉界面,顺利的话十分钟内就能看到第一条成片跑出来。完整的使用手册和常见问题都放在 short-video-factory.yils.blog,遇到问题先翻文档,比在 issue 区等回复快。

还有一点容易被忽略,但对做商业内容的人可能最重要:它完全本地化运行。素材、文案、任务数据、成片全部存在你自己的电脑里(本地 SQLite 库 + 本地文件),不经过任何第三方服务器。你那些还没发布的新品素材、内部培训内容、未公开的营销脚本,都不需要先上传到别人的云上再拿回来——这个隐私边界,在商业场景里值不少钱。

小黑抱着装满资料和胶片的箱子,用背把门关上,门外的云进不来
素材、文案、成片全在本机,云在外面,不上传

六、泼点冷水:这几个点想清楚再用

  1. AGPL-3.0 协议要看清。这是最容易被忽略、也最容易踩坑的一条。AGPL 的特点是带”网络传染性”:如果你拿它的源码改出一个在线服务对外提供,你得同样把修改部分开源出去。个人自己用、公司内部用完全没问题,但基于它做闭源商用 SaaS 是不行的。想商用的,正确姿势是直接用它本体出片,而不是二开一个闭源版本拿去卖。
  2. 素材得你自己准备。它不生成画面——素材池里放什么,成片里就出现什么。如果你的期待是”一句提示词连画面都凭空长出来”,那你要找的是文生视频那类工具(Sora、可灵、即梦之类),不是它。它的定位是”已有素材的自动化组装”,不是”从零造素材”,这两件事别混。
  3. 文案质量取决于你接的模型。EdgeTTS 是白送的,但文案那一步用的是你自己的 API key、你自己的模型、你自己的账单。接个最便宜的小模型,就别指望口播文案有多惊艳;想要能带货的文案,还是得配个像样的模型,这笔开销要提前算进成本里。
  4. 字幕样式还在迭代中。新的字幕渲染引擎刚落地不久,路线图上的”多种字幕样式和特效”还没完全兑现,目前能调的参数有限。对字幕颜值和动效有很高要求的,建议先观望几个版本,或者导出后丢进专业剪辑软件再加工一道。

写在最后

这两年”AI 生成视频”的宣传,几乎都指向文生视频那种科幻场景——输入一句话,凭空长出一段以假乱真的画面。但真实情况是,对绝大多数每天要产出内容的人来说,需求朴素得多:把手上已有的素材,用可接受的成本,稳定地变成能发出去的视频。他们不缺想象力,缺的是把第 20 条片也做得和第 1 条一样不出错的那份体力。短视频工厂瞄准的正是这个被主流叙事忽略、却极其庞大的真实缺口。

它没有炫技,也没有蹭什么大模型概念,就是老老实实把文案、配音、剪辑、字幕这条流水线自动化了,然后给这条流水线配了一个 batch 按钮。5.2k 的 Star 数本身就是最好的证明:这个需求有多大,就有多少人被它戳中。更关键的是它的姿态——开源、本地运行、接口可换、协议清晰,没有把你锁进任何一家厂商的生态里。在到处都是”先用免费额度骗进来、再按月收割”的今天,这种姿态本身就值得尊重。

如果你是做产品营销的、做带货矩阵的、做知识付费切片的,或者只是单纯需要持续产出短视频的人,它值得占你硬盘里那 200MB 的位置。当然,也请对它有合理预期:它不会替你想出爆款选题,也不会凭空造出画面,它能做到的是把那些机械劳动从你身上卸下来,让你的时间重新回到判断和创意上。装上跑一条试试,十分钟就能知道它适不适合你的工作流——这个试错成本,低到几乎没有理由不去试。项目地址:github.com/YILS-LIN/short-video-factory · 官方文档:short-video-factory.yils.blog · 协议:AGPL-3.0

未经允许不得转载:AI TOOL PUSH » 短视频工厂:把一条短视频的生产线,装进一个桌面 App

评论 抢沙发

更好的WordPress主题

支持快讯、专题、百度收录推送、人机验证、多级分类筛选器,适用于垂直站点、科技博客、个人站,扁平化设计、简洁白色、超多功能配置、会员中心、直达链接、文章图片弹窗、自动缩略图等...

联系我们联系我们

登录

找回密码

注册