【学习工作赛道】Neoera Work - 基于开源二次开发的 AI Agent 桌面工作台

一、创意名称 + 创意介绍

创意名称:Neoera Work – AI 能看、能点、能设计的工作台

想解决什么问题

当前 AI 工具普遍存在三大核心缺陷:第一,AI 只能"对话",无法直接操作用户桌面上的真实应用和浏览器,大量重复性工作仍需人工完成;第二,现有闭源产品(Claude Desktop、GitHub Copilot、Codex)无法自定义扩展,用户被锁定在服务商的生态中,数据也存在隐私和合规风险;第三,编程和设计是割裂的两套工具链,开发者需要在 IDE、AI 助手、设计软件之间反复切换,上下文不断丢失,效率大打折扣。

为什么会想到做这个

在日常工作中有两点非常深刻的体会:第一,有很多重复性的桌面操作(填表、数据迁移、截图巡检等),AI 其实有能力完成,但缺乏一个让 AI 直接操控桌面的开源工具;第二,团队在协作时,Prompt 模板、设计规范、工作流配置无法在成员间有效共享。而开源社区已经有了优秀的基础项目 – OpenWork(开源 AI Agent 桌面平台)和 OpenDesign(开源设计引擎),它们提供了成熟能力但尚未组合在一起,也没有充分发挥 AI 对桌面的操控潜力。因此我们决定基于这两个开源项目进行深度二次开发,补齐 Computer Use、Browser Use 和 Automations 等关键能力,打造一个真正完整的工作台。

大概是什么产品

Neoera Work 是一款跨平台桌面端应用(Windows / macOS / Linux),基于 OpenWork 和 OpenDesign 开源二次开发。它在 OpenWork 的 AI Agent 工作台能力基础上,深度集成了 OpenDesign 设计引擎(Work/Design 双模式切换),并大幅扩展了 Computer Use(53 个 AI 桌面操控工具)、Browser Use(17 个 CDP 浏览器自动化工具 + VLM 视觉理解)和 Automations(7 种调度模式 + Self-Evolution 自我进化)三大核心模块。用户可以通过自然语言驱动 AI 完成从编码、设计到桌面操作、浏览器自动化、定时任务的全链路工作流。


二、目标用户及痛点

面向哪些用户

  1. 自动化测试工程师:需要频繁编写和维护 E2E 测试用例,但 Selenium/Playwright 代码量大、维护成本高。Neoera Work 让他们用自然语言描述测试场景,AI 自动执行并生成可视化报告。

  2. RPA 需求团队:需要替代昂贵的商业 RPA 方案(UiPath、Automation Anywhere 等年费数万),用开源工具实现跨应用数据迁移、报表生成、定时巡检。

  3. 隐私敏感型企业(金融/医疗/政务):数据不能上云,需要在本地私有化部署 AI 能力,同时保持团队协同。Neoera Work 的本地优先架构 + MIT 开源协议天然满足合规要求。

  4. AI Agent 开发者与研究者:需要深度定制 AI 行为、实验不同 LLM 和 Agent 架构,通过 53 个 Computer Use 工具 + MCP 扩展 + Skills 插件生态,快速搭建自定义 Agent 方案。

在什么场景下使用

  • 日常开发辅助:开发者每天在 IDE、ChatGPT、文档工具间切换,Neoera Work 将 AI 会话、代码编辑、设计原型整合在一个桌面应用中,保持工作流连续性

  • 重复性任务自动化:定时生成日报/周报、批量数据处理、代码审查、监控面板巡检等,通过 Automations 模块让 AI 7x24 小时自动执行

  • 跨应用数据迁移:从 Excel 读取数据 → 打开网页后台 → 逐条录入 → 保存确认,全流程由 AI 自动完成

  • 端到端 Web 测试:用自然语言描述测试用例,AI 通过 Browser Use 自动执行点击、输入、断言,生成 trace 报告

  • 设计即编码:在同一个应用中无缝切换"编码模式"和"设计模式",AI 驱动的设计引擎支持原型设计、仪表盘、PPT 等多种产出物

当前痛点

  1. AI 只会说,不会做:现有 AI 工具停留在"对话问答"层面,无法直接操作桌面应用和浏览器

  2. 浏览器自动化门槛高:Selenium/Playwright 需要编写大量代码,非开发者无法使用

  3. 闭源工具锁定生态:Claude Desktop、Codex 等闭源产品无法自定义扩展,数据被锁定在云端

  4. 编程与设计割裂:开发者和设计师使用完全不同的工具链,AI 无法同时服务两种需求

  5. 重复任务消耗大量时间:定时报告、批量处理、日常巡检等重复工作占据开发者大量精力

  6. 团队协作配置难以复用:AI 配置、Prompt 模板、工作流难以在团队内共享


三、核心功能详解

Neoera Work 的核心能力覆盖 6 大模块,以下逐一说明:

模块一:OpenDesign 内嵌设计引擎

Neoera Work 通过 Sidecar(伴随进程)模式深度集成了完整的 OpenDesign 设计引擎。用户可以在应用内通过一个 Trae 风格的分段选择器,在"Work 模式"(AI 编码/Agent)和"Design 模式"(AI 驱动设计)之间一键切换,无需离开应用。

Design 模式提供 100+ 设计技能(原型设计、仪表盘、PPT、社交媒体、邮件、PM 文档等),内置 150 个品牌级 DESIGN.md 设计系统(Linear、Stripe、Vercel、Airbnb、Apple、Tesla 等),以及 261 个官方插件。支持多种产出物类型:网页/桌面/移动原型、实时仪表盘、演示文稿(PPT/PDF/HTML)、HyperFrames 动态图形(HTML→MP4)、品牌图片生成。内置 AMR(Agentic Model Router)多模型路由,智能选择 GPT / Claude / Gemini / DeepSeek 等 20+ 旗舰模型。

技术实现上,OpenDesign daemon 作为子进程管理(启动/停止/重启/健康检查),Web UI 通过 Electron WebContentsView(非 iframe)嵌入主窗口,主题随 OpenWork 同步(dark/light CSS 变量映射),并通过 IPC bridge + API 代理路由实现通信。

模块二:Computer Use – AI 操控你的桌面

这是 Neoera Work 最核心的差异化能力。我们扩展了 53 个 MCP 工具,让 AI 能像人类一样看屏幕、点按钮、输文字、拖窗口。具体包括:

  • 标准契约 13 个:screenshot(截图)、click(点击)、type(输入)、key(键盘)、scroll(滚动)、drag(拖拽)等基础操控

  • 语义层 10 个:snapshot(结构化 UI 快照)、set_value(设值)、perform_action(执行动作)、check_permissions(权限检查)等高级语义

  • CUA 兼容层 10 个:cua_screenshot、cua_click、cua_type 等,兼容 Anthropic CUA(Computer Use Agent)标准

  • 应用管理 8 个:launch_app(启动应用)、activate_app(激活应用)、list_windows(窗口列表)、focus_window(聚焦窗口)等

  • OCR 屏幕识别 3 个:ocr_screen(全屏 OCR)、ocr_region(区域 OCR)、find_text(屏幕文本定位),对无法通过 API 获取内容的旧版桌面应用,AI 通过 OCR "看懂"屏幕文字

  • 受限 Shell 2 个:run_command(命令执行)、fs_read/write/list(文件操作),白名单 + 超时双重保护

安全机制方面,支持严格后台模式(postToPid 后台输入,不抢焦、不干扰用户)、Stale Snapshot 检测(窗口变化时自动撤销失效操作)、第二光标 Overlay(可视化提示 AI 操作位置)、TCC / UAC 权限隔离(macOS Accessibility + Windows UIA)。

跨平台实现:macOS 端基于 Swift 原生 Accessibility API + ScreenCaptureKit,Windows 端基于 Rust windows-rs + UIA COM 接口,两端通过 MCP 协议暴露完全一致的工具契约。

模块三:Browser Use – AI 驱动浏览器

通过 Chrome DevTools Protocol (CDP) 与浏览器建立 WebSocket 连接,提供 17 个浏览器自动化工具:browser_navigate(URL 加载)、browser_snapshot(DOM 快照)、browser_click / browser_type(点击与输入)、browser_tabs(多标签页管理)、browser_screenshot(页面截图)、browser_wait_for(智能等待)、browser_evaluate(执行 JS)、browser_network_requests(网络请求监控)等。

独家特色是 VLM 视觉理解能力:当 DOM 无法定位元素时(如 Canvas、Video、地图标记),AI 通过视觉大模型(Qwen-VL)"看懂"屏幕画面,返回元素坐标并执行点击,实现 DOM + 视觉双通道融合定位。

模块四:Automations – 让 AI 7x24 自动工作

内置完整的定时自动化任务系统,支持 7 种调度模式:cron(5 字段 vixie-cron 表达式 + IANA 时区)、interval(固定间隔,最小 60 秒)、once(一次性触发后自动禁用)、hourly / daily / weekdays / weekly 预设模式。

4 种触发方式:scheduled(调度器自动触发)、manual(UI 手动 Run Now)、webhook(HTTP POST,支持 GitHub Actions / Slack 等外部系统触发)、session_loop(Chat 会话内 /loop 命令创建临时 routine)。

Prompt 模板系统支持 {{ path.to.field }} 占位符渲染,自动注入 workspace / trigger / user / run / env 上下文,并支持默认值语法。

独家 Self-Evolution 功能:每次成功的 run 会自动喂回进化系统,AI 分析执行过程后生成优化提案(3 种类型:skill 结晶化、prompt 优化、调度调整),用户可 Accept/Reject 并支持 rollback。

安全机制包含 4 种权限模式(ask 默认安全 / auto / plan / bypass)、Approval Flow 审批流、Webhook Token 安全(SHA-256 hash 存储 + timing-safe 比较 + 限流 + 异常检测 + IP 白名单)、Payload 脱敏(25+ 敏感 key 自动脱敏 + PI 脱敏:邮箱/手机号/信用卡/IP)、append-only 审计日志。可观测性方面提供 Dashboard 统计卡片、Run Timeline、SSE 实时事件流、Prometheus Metrics 和 24h 时序数据。

错误处理支持指数退避重试(60s → 5min → 25min)、Catch-up 补跑机制(daemon 重启后补跑错过的任务)、并发控制(默认 5 个并发 run)、30 分钟超时和 90 天自动归档。

模块五:多会话 AI 工作流 + Skills/MCP 扩展

继承 OpenWork 的核心能力:支持创建多个独立 AI 会话,每个会话可绑定不同项目文件夹、Skills 配置和 LLM 模型,支持 50+ 种 LLM(OpenAI、Claude、Ollama 本地模型等)。通过 SSE 实时流式传输,AI 响应即时可见。

Skills & MCP 扩展生态支持可视化 Skills 管理器(一键安装/卸载)、OpenCode 原生插件生态、MCP 服务器连接外部工具、项目级与全局级双重配置。执行计划可视化将 AI 任务分解为 Todo 时间线,用户可查看每步状态、耗时和结果。

模块六:本地优先 + 团队共享

默认本地运行所有 AI 工作流,数据不出本机(127.0.0.1 默认绑定)。需要协作时可一键连接远程服务器。支持将常用 AI 工作流保存为模板,通过链接分享给团队成员一键导入。


四、价值与意义

效率提升维度

Neoera Work 将原本分散在 5-6 个工具中的能力(AI 对话、代码编辑、设计原型、浏览器自动化、RPA 桌面操控、定时任务)整合到一个桌面应用中。AI 自动处理重复性桌面操作和浏览器任务,开发者可将精力聚焦于创造性工作。Automations 的 Self-Evolution 让 AI 任务越跑越优化,团队效率持续提升。

社会价值维度

Neoera Work 基于 OpenWork 和 OpenDesign 两个开源项目二次开发,遵循 MIT 和 Apache-2.0 开源协议。它让个人开发者和小团队无需购买昂贵的商业 RPA 工具和 AI 助手订阅,也能享受到企业级的 AI 自动化能力。本地优先架构确保敏感数据不出本机,开源代码完全可审计、无后门风险,让金融、医疗、政务等隐私敏感行业也能安全地采用 AI 工具。Project Claude Cowork / Codex 等闭源产品的用户也有了一个功能更强、完全可控的开源替代方案。


五、创意产物

openwork-trae-ai-creativity-entry.html (1.2 MB)

1 个赞