【学习工作】灵感驱动-面向创作者的端到端AI Agent内容生产平台

  1. 自己介绍
  • 我是一名大三学生,性格开朗、积极向上,脑子里总有一些天马行空的想法,喜欢用代码把想象力变成能跑的产品,独立跑通“前端 + 云函数 + 模型训练 + 部署上线”的全链路开发。这个作品的起点源于有次和朋友出去玩,刷到一个爆款视频想拍同款,却发现运镜、节奏、口播全靠肉眼扒进度条,折腾半天也没拍明白。当时就想:要是上传一个视频,AI 能自动帮你拆成镜头清单,告诉你每段怎么拍,多好? 结果这一个念头,牵出了热点推荐、人设引擎、多Agent脚本生成,最终长成了一个完整的AI创作闭环——【灵感驱动】就是从"想拍同款"这件小事长出来的。

  • 这次复赛我选择个人参赛,独立完成了产品定义、前端、云函数、Prompt工程Wan2.1 LoRA训练和云端部署的全流程。我把一个真实痛点从0做到能跑、能用、能给人惊喜——蹲免费GPU训模型、在FFmpeg里抠字幕参数、云托管部署踩坑,这些过程让我相信:好产品不一定要从完美规划开始,但一定要从真实的痛点出发,再加上一点想象力。 有了TRAE的加持,一个人也能像一个微型团队一样战斗。

  1. 产品简介
  • 是什么:【灵感驱动】是一款面向短视频创作者的AI Agent小程序,以人设为核心锚点,串联起热点信号 → 智能选题 → 多Agent脚本生成 → 爆款视频拆解 → AI形象成片的完整创作闭环。

    产品形态:微信小程序 + 云端Node.js服务 + 自训练Wan2.1 LoRA推理 Worker
    核心定位:让每一个KOC都拥有自己的"专属内容Agent",从"选题盲飞"走向"确定性创作"

  • 面向谁:

  • 完整功能:

  • 人设档案(Persona Engine):人设是整个产品的"锚点"——所有后续环节(热点推荐、脚本生成、镜头拆解)都围绕人设展开。没有精准的人设,就没有个性化的创作。

  • 多维度人设建模:赛道 / 垂直领域 / 子垂类 / 受众画像 / 发布平台 / 语气风格 / 表达禁忌

  • 首次使用引导式填写,支持后续随时迭代优化

  • 人设数据结构化存储于云端,跨会话持久化

  • 支持人设历史记录(最多10条),每次生成时携带完整人设上下文

  • 实时热点信号库:解决了创作者"每天刷热榜找选题"的时间消耗问题。

  • 多源聚合:自动采集抖音热榜、小红书、百度热搜等实时信号

  • 自建垂类库:运营后台支持手动录入垂类热点,补充算法采集的盲区

  • 定时采集:每日3次(6:00 / 12:00 / 18:00)自动采集,非敏感热点自动发布

  • 敏感内容过滤:关键词黑名单 + 风险分级(涉政、涉军、涉外交等自动下架)

  • 智能标签与赛道匹配:每条热点自动打标签,按赛道分类,一键筛选"与我相关"

  • 6维匹配度评分:不是简单的标签匹配,而是基于人设的多维度量化评分

  • 热点管理后台:

  • 多Agent 脚本生成:这是产品的核心引擎——不是一次LLM调用,而是一条完整的生产流水线。

  • 三派并行生成:创意派(temp=0.9,追求爆款潜力/保守派(temp=0.5,稳妥可靠)/ 平衡派(temp=0.7,兼顾两者)

  • Judge 评审机制:8维度加权打分(热点紧扣度 ×1.5、可拍摄性 ×1.2、停留力 ×1.3、信息密度 ×1.2、圈层词融入 ×1.0、平台适配度 ×1.0、分镜质量 ×1.0、互动设计 ×0.8),自动选出最优方案

  • RAG 知识增强:HNSW向量索引 + BM25关键词检索混合,自动注入垂类知识、圈层黑话、爆款句式

  • Prompt工程:4-D方法论 + Few-Shot 正例 + 5类反例教学 + 7项自检清单

  • 脚本完整性输出:标题(3备选)+ 钩子 + 正文 + CTA + 分镜脚本(每段含视觉描述 + 口播文案 + 屏幕文案 + 时长)+ 圈层词列表 + 标签 + 合规自检要点

  • 偏好记忆系统:用户评分与发布数据回流,Agent越用越懂你

  • 自动降级:多Agent 链路异常时降级到单Agent + Critic修复模式

  • 拍同款爆款视频拆解:这是整个产品的起点功能——从"想拍同款"这个痛点长出来的。

  • 上传参考视频 → 自动上传至云存储 → 服务端FFmpeg抽帧 → 镜头级分析
    输出:镜头类型(口播镜/演示镜)、运镜轨迹(推/拉/摇/移/固定)、构图提示(近景/中景/俯拍/特写)、时长建议

  • 提词器跟拍模式:边看口播文案边拍摄,逐帧对齐参考视频节奏

  • 异步处理架构:上传后立即返回,后台轮询进度,不阻塞用户操作

  • AI 形象成片:从脚本到可发布视频的最后一环,支持四引擎可选

  • 分镜级生成:按脚本分镜逐段生成,自动拼接为完整视频

  • TTS配音:中文edge-tts,口播文案与语音一一对应,失败即报错不出无声片

  • 字幕烧录:FFmpeg自动叠加,可配置开关

  • 多段拼接:FFmpeg concat协议,libx264编码,faststart优化移动端播放

用户完整使用路径:

首页 → 完善人设 → 浏览热点(查看匹配度评分)→ 勾选选题 → 一键生成脚本
→ 查看分镜(口播镜+演示镜混排)→ 参考爆款拆解(拍同款)
→ 提词拍摄 / AI 形象成片(四引擎可选)→ 发布

  • 相比初赛Demo的升级:

  • 升级一:训练并接入 Wan2.1 LoRA 模型,视频生成从"调用 API"升级为"自训练模型"

    初赛 Demo的视频生成完全依赖第三方 API(豆包 Seedance / 智谱 CogVideoX),只能调接口,无法控制画面风格和镜头语言——豆包生成的视频"不像口播",智谱的分镜"太随机"。

    复赛作品在魔搭 ModelScope 24GB 免费GPU 上,基于Wan2.1-T2V-1.3B底座完成了两套 LoRA 微调,并自建推理 Worker 接入小程序。这意味着 Inspire Engine 的视频生成不再是纯 API 调用,而是拥有了一套自己训练、可控风格、可持续迭代的生成能力。

  • 升级二:多Agent 流水线 + Prompt 工程深度优化,脚本质量大幅提升
    初赛Demo用单个LLM一次性生成脚本,存在三个核心问题:输出风格单一(每次都像同一个人写的)、容易空洞套话(“提升认知”“结合热点分享干货”)、圈层词融入生硬(要么不用要么乱堆砌)。

    复赛作品从四个层面做了深度升级,每一层都针对一个具体问题:

  • 多Agent投票流水线:从"一个模型写"到"三个模型比赛写"

  •     ┌─ 创意派 Agent(temp=0.9,追求爆款潜力,大胆选题角度)
    
    人设 + 热点 ──→ ├─ 保守派 Agent(temp=0.5,稳妥可靠,避坑优先)  ──→ Judge Agent           ──→ 最优方案
    └─ 平衡派 Agent(temp=0.7,兼顾创意与可执行性)
    
    Judge 按 8 维度加权打分:
    热点紧扣度(×1.5)  —— 脚本是否紧扣热点标题核心关键词
    可拍摄性(×1.2)    —— 每个分镜是否有具体可拍的物体/动作
    圈层词融入(×1.0)  —— 垂类黑话是否自然融入语境,非生硬堆砌
    平台适配度(×1.0)  —— 是否符合目标平台的内容调性
    停留力(×1.3)      —— 开头钩子能否让用户停止滑动
    信息密度(×1.2)    —— 单位时长内的有效信息量
    分镜质量(×1.0)    —— 口播镜+演示镜混排、镜头类型规范
    互动设计(×0.8)    —— CTA 与评论引导设计
    
  • Prompt 工程:从"写一段脚本"到"结构化生成规范",系统提示词经历了从初赛的"基础指令"到复赛的"结构化生成规范"的质变。核心是4-D方法论 + Few-Shot正反例教学 + 7 项自检清单:

    4-D方法论:
    Define:定义角色——你是这个人设的KOC,用ta的语气说话
    Decompose:拆解维度——热点核心词、圈层词、目标平台调性、受众痛点
    Draft:生成草稿——按分镜结构输出(口播镜+演示镜混排)
    Deliver:自检交付——逐项确认7项检查清单后输出
    

    升级三:人设-热点匹配度从"标签匹配"升级为"6 维评分算法"

    初赛 Demo的热点推荐仅靠标签匹配——人设标签是"美妆",热点标签里有"美妆"就推荐。问题是:很多热点虽然标签匹配,但与人设的受众画像、内容调性完全不符,导致推荐"与人设无关"的热点。

    复赛作品 设计了computePersonaConsistency 6维评分算法(0-100 分),让每条热点都有一个可量化、可解释的匹配度分数

  • 质量评分公式

    image

  • 升级四:web管理后台

  • 知识库:维护垂类创作“语料底座”的核心页面。

  1. 产品演示视频:
  1. 产品创作历程:
  • 这个作品的起点其实特别生活化——有次和朋友出去玩,刷到一个爆款视频想拍同款,却发现运镜、节奏、口播全靠肉眼扒进度条,折腾半天也没拍明白。我就想:要是能上传一个视频,AI自动帮你拆成镜头清单,再告诉你每段怎么拍,那该多好?结果这一个念头,牵出了热点推荐、人设引擎、多Agent脚本生成,最终长成了一个完整的AI创作闭环。在打磨过程中,我遇到的核心挑战是"AI生成质量"——单模型写脚本风格单一、纯API生视频不可控、热点推荐与人设不匹配。
  • 为此我做了三件事:设计了三派并行 + Judge评审的多Agent流水线,让脚本质量有明确的质量下限;在魔搭免费GPU上训练了两套Wan2.1 LoRA,让视频生成拥有可控风格;并实现了6维人设匹配算法和RAG知识增强,让热点推荐和圈层词融入从"碰运气"变成"可量化"。
  • 整个开发过程基于TRAE IDE完成,从项目脚手架搭建、多Agent流水线设计、RAG知识库实现,到视频拆解模块开发、Wan LoRA接入、云端部署联调——TRAE贯穿了每一个关键任务的落地。踩过不少坑:Windows 打包路径在云托管上报错、Dockerfile静默构建失败、FFmpeg字幕烧录参数调整、24GB显存训练OOM反复调参。独立跑通前端、云函数、模型训练、部署上线全链路。我相信好产品不一定要从完美规划开始,但一定要从真实的痛点出发——灵感驱动就是从"想拍同款"这件小事,一步步长出来的。
  1. 技术架构
  • 端到端的AI内容生产闭环

    本项目采用前后端分离 + 自建推理服务的现代化云原生架构。它以微信小程序为用户交互入口,以 Serverless 云函数为业务处理核心,以Node.js自建推理服务为算力延伸,构建了一条从"热点发现"到"AI 成片"的自动化流水线。

  • 前端层:原生微信小程序C端

    选择微信原生开发框架(WXML/WXSS/JS),而非跨平台方案。这样做的好处是可以直接调用微信云开发能力,无需中间层转换,保证了极致的性能和原生交互体验。

    核心模块

    • 人设档案:作为整个产品的"锚点",用户通过它定义自己的账号定位、垂直赛道和目标受众。
    • 热点采集库:实时聚合抖音、小红书、百度三大平台的热点事件,支持按平台标签页筛选。
    • 一键生成:连接前端与后端AI大脑的触发点,将人设与选中的热点组合,送入生成流水线。
    • 形象成片:上传人像照片,调用后端AI视频生成引擎,快速产出动态视频。
    • 同款拆解:上传爆款视频,利用FFmpeg技术自动分析镜头语言,输出复刻指南。
  • Serverless 云函数层

完全部署在微信云开发的Serverless环境中,承担核心AI逻辑,是整个系统的"大脑"。由三个云函数协同工作:

  • 热点采集与分析

通过定时触发器在每日 6:00、12:00、18:00 自动执行,实现无人值守的热点监控:

  • 多源并行采集:同时请求抖音、小红书、百度实时热榜API,任一数据源故障不影响其余采集

  • 智能去重与归一化:跨平台重复热点自动识别,不同量级热度值压缩到统一 50-99分区间

  • 赛道反推:根据热点标签自动推断所属垂直赛道,且该推断优先级高于人设自填赛道,避免内容错位

  • 敏感词自动拦截:命中敏感规则(领导人/外交/军事/俄乌等)的热点自动隐藏,其余即刻发布上线

  • AI 脚本生成核心

系统中最复杂的模块,实现了基于RAG 检索增强 + 多 Agent 的高级内容生产流水线,完整 8 步闭环如下:

  • 热点重排 → 锁定主选题:先按人设匹配度对选中热点智能排序,再选出最优热点作为本次创作核心方向
    
    知识注入 → RAG精准检索:从种子库、运营云库和LLM动态补充三路加载知识,随后通过自研HNSW 向量索引(O(log n) 毫秒级检索)与 BM25关键词检索混合执行——语义权重 0.6、关键词权重 0.4,兼顾深度与广度
    
    构建画像 →多Agent并行创作:确定平台适配、语言节奏和风格走向后,同时启动三个 Agent并行生成候选脚本
    
    Judge评审 → Critic质检修复:高审慎 Agent 从8个维度加权打分选出最优脚本;若Critic规则质检不达标,会带着失败项要求LLM重写,形成闭环修复,显著降低废品率
    

此外,该模块还承载了两项自研能力:

  • 6 维人设-热点匹配算法:从赛道关键词、垂直领域、受众画像、人设禁忌、赛道冲突、子赛道精确匹配六个维度计算匹配分,输出"优先做/可跟/观察/跳过"决策标签

  • 偏好记忆系统:用户高分脚本的模式被标记为"偏好"并 boost,高互动率视频的切入角度会被学习,这些"记忆"作为 Few-Shot 注入下一次生成,让 AI 越用越懂用户

  • AI 视频生成层 — 四引擎可选架构

这是系统的"视觉工厂",设计了多引擎调度机制,支持在不同成本与效果等级间灵活切换,且任一引擎失败自动降级到下一个:

  • FFmpeg 免费合成:静态图片 + TTS 配音 + 字幕烧录,确保所有用户都能免费用
  • 智谱CogVideoX:图生视频,异步任务轮询,生成具有动态效果的视频
  • 字节方舟Seedance:支持首帧参考与音频生成,画质效果最佳
  • 自训练 Wan2.1 LoRA:基于开源 Wan2.1-T2V-1.3B底座,使用LoRA技术微调了两个专属风格权重(lora_demo演示镜风格 /lora_talk 口播镜风格),部署在自建 FastAPI Worker上提供真推理服务。生成时按镜头类型动态切换 LoRA,完全掌控视频风格

调度策略上,当用户显式选择wan引擎时不回退到豆包/智谱,以保证自研风格一致性;多分镜模式下逐段生成,单段失败则跳过继续,非阻塞。

  • LLM 调度层 — 多模型自动降级

为保证服务稳定性,设计了串行尝试的 LLM 调度机制:

  • 主备模型链:主力为智谱 GLM-4-Flash,备用为阿里通义 Qwen-Turbo,按配置顺序依次调用,成功即返回,失败自动切换

  • 超时控制:单请求 60 秒超时,超时视为失败并切下一个,避免单 API 卡顿阻塞整条流水线

  • Embedding 三级降级:智谱 embedding-3→ 通义 text-embedding-v2→ 本地FNV-1a哈希,确保 RAG 检索在任何情况下都不中断

  • 数据存储层 — 云原生与本地协同

  • 微信云数据库:主要持久化存储,管理热点数据、采集日志、人设知识库、敏感规则等结构化数据

  • 小程序本地存储:轻量级数据如用户偏好、最近脚本包缓存、人设历史存于本地,提升读取速度并减轻云端压力

  • 微信云存储:承载 AI 生成视频、用户上传素材、FFmpeg 中间产物等非结构化媒体资源

  • 管理后台 — Vue3 Web 控制台

基于 Vue 3 Composition API + Element Plus + Vite 构建的独立 Web 管理后台,通过 Bearer Token 鉴权对接自建推理服务的 /api/v1/* 路由:

  • 数据看板:运营数据总览,展示采集量、生成量、使用趋势
  • 热点运营:审核、发布、下架、手动录入热点
  • 知识库管理:维护垂直赛道的圈层词、标题句式、钩子模板等核心资产
  • 敏感规则配置:可视化编辑分类关键词,所见即所得

6. 产品亮点

  • 自训练LoRA + 多引擎视频生成:不依赖单一API,拥有自己训练、可控风格、可持续迭代的视频生成能力。口播镜走talk LoRA、演示镜走demo LoRA,按镜头类型智能切换

  • 多Agent + Judge评审:三派并行生成,8维度加权评审,质量远超单模型。异常时自动降级到 Critic 修复模式

  • RAG知识增强:HNSW向量 + BM25混合检索,让脚本自然融入圈层黑话,不生硬、不堆砌

  • 6维人设匹配算法:不是标签匹配,而是可量化、可解释的多维评分

  • 偏好记忆系统:用户评分与发布数据回流,≥3 样本自动调整权重,Agent越用越精准

  • Prompt工程体系:4-D方法论 + 正反例Few-Shot + 7项自检清单 + 分镜混排硬约束,从源头控制输出质量

  • 完整出片闭环:热点 → 脚本 → 拆视频 → AI 成片,一站式覆盖,无需在多个工具间切换

  • 零门槛体验:无需备案、无需上架,评审扫码即用;FFmpeg免费引擎兜底,全员可用

    7. 商业化与社会价值

  • 商业化:

  • 会员订阅制:采用按月/按年会员订阅模式,面向的不同的人群提供不同等级的会员权益。

  • 会员可以不限次数生成脚本,可以反复选题、优化分镜和发布文案;视频生成功能按照会员等级配置固定次数,如基础会员享有基础视频额度,专业会员享有更高生成次数。超出免费额度后,用户可按次购买或开通更高等级会员。

  • 社会价值:

  • 降低内容创作门槛:让素人也能获得专业级内容生产力,不必因为"不会写脚本""不会拍"而放弃表达

  • 提升内容质量:通过多 Agent 评审 + 合规自检 + RAG 知识增强,减少低质同质化内容生产
    赋能知识型创作者:帮助垂直领域(教育、科普、职场、健康等)的创作者更高效地输出有价值的知识内容

8.TRAE 实践过程:

  • 让TRAE基于项目现有的AI成片能力,分析后续应该训练什么视频模型以及如何设计微调方案。

Session ID 1:1993833686239136:f7821129a58a49141d63946997e04a8e_6a65a649501cb4ee83443757.6a65a64b501cb4ee8344375a.6a65a649501cb4ee83443758:TRAE Work CN.0.1.39.no_sid.no_ppe.T

  • 将自己整理的训练思路和Skill提供给TRAE,让它按照明确的工程目标生成可执行方案。这个Skill里包含了数据准备、视频切段、caption标注、DiffSynth + Wan2.1 + LoRA训练、TensorBoard观察、定期导出mp4验证、产物保存以及接入小程序成片服务等步骤。

Session ID 2:1993833686239136:10a43a34224bd6ab041b6cb14185b749_6a65a649501cb4ee83443757.6a65b3c4501cb4ee834438a4.6a65b3c4501cb4ee834438a2:TRAE Work CN.0.1.39.no_sid.no_ppe.T

  • 让TRAE帮我把Wan模型接进项目,先分析服务端的视频生成链路和wan-infer-worker推理服务结构,然后对推理端和配置文件进行了改造。

Session ID 3:1993833686239136:48abee01e9159c442d8b946614beda35_6a69997e501cb4ee83443ac6.6a6ef0e8cb5db42f879bf750.6a6ef0e7cb5db42f879bf74e:TRAE Work CN.0.1.39.no_sid.no_ppe.T

  • 使用TRAE对产品交互流程进行了优化。先分析现有的功能交互,让它先阅读项目里脚本历史和视频生成相关代码,再帮我设计更合理的交互方案。

Session ID 4:1993833686239136:b532e74119a6121f4a69059319dc8385_6a6aeda2320a2a33898ea545.6a6aeda2320a2a33898ea548.6a6aeda2320a2a33898ea546:TRAE Work CN.0.1.39.no_sid.no_ppe.T

Session ID 5:1993833686239136:ba905cd79f3097de97ee23c6a31cac40_6a6aeda2320a2a33898ea545.6a6aee9a320a2a33898ea58d.6a6aee9a320a2a33898ea58b:TRAE Work CN.0.1.39.no_sid.no_ppe.T

  • 使用TRAE对项目的整体工程链路进行了优化。针对脚本生成质量不稳定、知识匹配不够精准、Agent 流水线需要进一步增强的问题,让TRAE先阅读项目架构,再从Prompt工程、匹配度和Agent流水线三个维度给出系统性建议。TRAE分析后梳理出当前流程是“用户输入 → 趋势匹配 → RAG知识检索 → LLM生成 → Critic质检 → 修复 → 交付”,并建议继续增强语义检索、Few-Shot示例、结构化输出和质检闭环。

Session ID 6:1993833686239136:86992b4fc070fc66d9887158f08e42c9_6a6aeda2320a2a33898ea545.6a6afe61320a2a33898ea78c.6a6afe61320a2a33898ea78a:TRAE Work CN.0.1.39.no_sid.no_ppe.T

Session ID 7:1993833686239136:b99813d6c9ae2ed244519bcf85f60824_6a6aeda2320a2a33898ea545.6a6b0250320a2a33898ea86f.6a6b0250320a2a33898ea86d:TRAE Work CN.0.1.39.no_sid.no_ppe.T

  • 使用TRAE完成了Web管理后台的工作台入口接入和交互。

Session ID 8:1993833686239136:ff0109e6721acc87feecdd828e9af06a_6a7583fe40eed9fa67fe5ac4.6a7583ff40eed9fa67fe5ac7.6a7583fe40eed9fa67fe5ac5:TraeWork CN.0.1.45.no_sid.no_ppe.T

1 个赞