Agent 基建正在从“会调用工具”进入“安全执行环境”。 OpenAI 的 Windows Codex sandbox、Claude Code auto mode、LangSmith Sandboxes 都指向同一个问题:企业不会为 demo 付大钱,会为可控执行、权限治理、审计和恢复付钱。
今日重点项目雷达
nexu-io/open-design
是什么:本地优先、开源的 Claude Design 替代品,内置 19 个 Skills 和 71 套品牌级设计系统,可生成 Web / 桌面设计资产。;判断标签:趋势增强
Source ↗alchaincyf/huashu-design
是什么:Claude Code 里的 HTML 原生设计 skill,覆盖高保真原型、幻灯片、动画、MP4 导出和多维评审。;判断标签:趋势增强
Source ↗op7418/guizang-ppt-skill
是什么:Claude Code Skill,把 prompt 转为横滑杂志风 HTML deck,包含布局、主题和 WebGL 背景。;判断标签:趋势增强
Source ↗数据来源:AI HOT + GitHub 近期爆发项目 + BestBlogs 今日精选 + Follow Builders 建造者 feed + 必要核实。筛选标准:实时性、增速、AI/Agent 相关度、对 ABU9/OpenClaw 的启发。
一、今日主线判断
Agent 基建正在从“会调用工具”进入“安全执行环境”。 OpenAI 的 Windows Codex sandbox、Claude Code auto mode、LangSmith Sandboxes 都指向同一个问题:企业不会为 demo 付大钱,会为可控执行、权限治理、审计和恢复付钱。
AI coding 的竞争点从模型转向 skill / workflow 生态。 最近爆发项目里,设计 skill、PPT skill、Codex 增强、Claude Code token 优化密集出现,说明用户已经开始买“可复用工作方式”,不是只买模型能力。
系统记录层正在被动作层重写。 a16z、Notion、Vercel、LangChain 的信号都在说:下一代企业软件不是记录业务,而是捕获上下文、发起动作、留下执行痕迹。
中文 AI 工具生态开始出现实用派分叉。 CodexPlusPlus、OpenSquilla、微信群聊总结 Skill、Codex skill 清单这类内容,说明国内用户开始围绕“便宜、稳定、能跑起来”自建工具链。
汽车 AI 今天有一个高相关输入:Waymo 长访谈。 Follow Builders 采到 Training Data 对 Waymo Dmitri Dolgov 的访谈,适合 ABU9 从“自动驾驶”之外看车企 AI:大规模真实运营、长期安全迭代、数据闭环才是核心壁垒。
二、GitHub 近期爆发项目
nexu-io/open-design
- 是什么:本地优先、开源的 Claude Design 替代品,内置 19 个 Skills 和 71 套品牌级设计系统,可生成 Web / 桌面设计资产。
- 元数据:创建 2026-04-28;stars 39687;最近更新 2026-05-14;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:趋势增强
- 意味着什么:设计类 agent 已经从“生成一页 HTML”进化到“设计系统 + skill 包 + 本地工作流”。OpenClaw 的 artifact / PPT / HTML 能力应该向可复用设计系统靠拢。
- 链接:https://github.com/nexu-io/open-design
alchaincyf/huashu-design
- 是什么:Claude Code 里的 HTML 原生设计 skill,覆盖高保真原型、幻灯片、动画、MP4 导出和多维评审。
- 元数据:创建 2026-04-19;stars 13608;最近更新 2026-05-10;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:趋势增强
- 意味着什么:中文用户对“AI 生成可交付设计资产”的需求很强,且更偏交付场景。ABU9 的售前方案、汇报材料、原型展示都能吃到这类能力。
- 链接:https://github.com/alchaincyf/huashu-design
browser-use/browser-harness
- 是什么:面向 LLM 的自修复浏览器 harness,用于让模型完成浏览器任务。
- 元数据:创建 2026-04-17;stars 12551;最近更新 2026-05-13;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:趋势增强
- 意味着什么:浏览器仍是企业 agent 最现实的入口,尤其是旧系统、SaaS、后台管理工具。OpenClaw 的 browser-automation skill 要持续吸收这种 harness 思路。
- 链接:https://github.com/browser-use/browser-harness
op7418/guizang-ppt-skill
- 是什么:Claude Code Skill,把 prompt 转为横滑杂志风 HTML deck,包含布局、主题和 WebGL 背景。
- 元数据:创建 2026-04-23;stars 8508;最近更新 2026-05-13;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:趋势增强
- 意味着什么:PPT/HTML deck 已经是 AI skill 生态里最容易被业务侧感知的高频场景。ABU9 可以优先把方案、周报、客户汇报做成标准 skill。
- 链接:https://github.com/op7418/guizang-ppt-skill
strukto-ai/mirage
- 是什么:面向 AI Agents 的统一虚拟文件系统。
- 元数据:创建 2026-05-06;stars 2175;最近更新 2026-05-14;采集窗口/来源查询 new_14d_200_ai_agent。
- 判断标签:新变量
- 意味着什么:Agent 需要自己的文件系统抽象,不只是读写本地文件。长期看,这会影响 memory、artifact、workspace、权限边界的设计。
- 链接:https://github.com/strukto-ai/mirage
BigPizzaV3/CodexPlusPlus
- 是什么:CodexApp 增强工具,目标是让 Codex 更好用、更舒服。
- 元数据:创建 2026-05-06;stars 2045;最近更新 2026-05-14;采集窗口/来源查询 new_14d_200_ai_agent。
- 判断标签:趋势增强
- 意味着什么:Codex 周边生态开始长出来,和今天 X 上 Codex skill 清单互相印证。低成本 + 低账号摩擦会推动中文开发者转向 Codex 工具链。
- 链接:https://github.com/BigPizzaV3/CodexPlusPlus
vercel-labs/deepsec
- 是什么:由 coding agents 驱动的代码库安全漏洞发现 harness。
- 元数据:创建 2026-04-30;stars 2526;最近更新 2026-05-07;采集窗口/来源查询 new_14d_200_ai_agent。
- 判断标签:趋势增强
- 意味着什么:AI coding 的下一层价值不是写代码,而是自动找风险、跑审计、生成修复建议。企业落地时,这比“多写几行代码”更容易拿预算。
- 链接:https://github.com/vercel-labs/deepsec
MemPalace/mempalace
- 是什么:开源 AI memory system,主打 benchmark 和免费使用。
- 元数据:创建 2026-04-05;stars 52153;最近更新 2026-05-14;采集窗口/来源查询 fresh_90d_active_ai_agent。
- 判断标签:待验证
- 意味着什么:AI memory 仍是热点,但高 star 项目需要警惕营销水分。对 OpenClaw 来说,值得拆它的 schema、评测方式和长期记忆接口,不宜直接跟风。
- 链接:https://github.com/MemPalace/mempalace
三、最近 7 天新项目:值得点开
vercel-labs/zero-native
- 是什么:用 Zig + Web UI 构建桌面和移动应用。
- 元数据:创建 2026-05-08;stars 3361;最近更新 2026-05-13;采集窗口/来源查询 new_7d_100。
- 判断标签:新变量
- 意味着什么:本地应用和 Web UI 的边界继续融合,未来 agent 桌面端可能不再是 Electron 单一路径。
- 链接:https://github.com/vercel-labs/zero-native
huangserva/3DCellForge
- 是什么:AI 驱动的交互式 3D 模型生成、检查和展示 studio。
- 元数据:创建 2026-05-10;stars 1906;最近更新 2026-05-14;采集窗口/来源查询 new_7d_100。
- 判断标签:新变量
- 意味着什么:AI artifact 不只局限 PPT/网页,3D 生成和展示开始进入实用工具形态。汽车展厅、零部件说明、售后培训有潜在结合点。
- 链接:https://github.com/huangserva/3DCellForge
HermannBjorgvin/Clawdmeter
- 是什么:ESP32 桌面仪表盘,显示 Claude Code 使用量。
- 元数据:创建 2026-05-11;stars 730;最近更新 2026-05-12;采集窗口/来源查询 new_7d_100。
- 判断标签:待验证
- 意味着什么:AI coding 已经有“用量可视化”的周边需求。OpenClaw 如果做团队治理,成本/会话/工具调用仪表盘比炫酷硬件更有价值。
- 链接:https://github.com/HermannBjorgvin/Clawdmeter
haydenbleasel/files-sdk
- 是什么:统一对象存储和 blob 后端的轻量 SDK。
- 元数据:创建 2026-05-08;stars 655;最近更新 2026-05-14;采集窗口/来源查询 new_7d_100。
- 判断标签:新变量
- 意味着什么:Agent 处理文件时需要统一存储抽象,尤其是跨本地、云盘、对象存储的 artifact 流转。
- 链接:https://github.com/haydenbleasel/files-sdk
aattaran/deepclaude
- 是什么:用 DeepSeek V4 Pro、OpenRouter 或任意 Anthropic-compatible backend 复用 Claude Code autonomous agent loop。
- 元数据:创建 2026-05-03;stars 1839;最近更新 2026-05-09;采集窗口/来源查询 new_14d_200_ai_agent。
- 判断标签:趋势增强
- 意味着什么:用户想保留 Claude Code 的交互和 agent loop,但替换更便宜或更稳定的模型后端。模型抽象层会成为 AI coding 工具的标配。
- 链接:https://github.com/aattaran/deepclaude
mattpocock/dictionary-of-ai-coding
- 是什么:用普通语言解释 AI coding 术语。
- 元数据:创建 2026-05-01;stars 1570;最近更新 2026-05-07;采集窗口/来源查询 new_14d_200_ai_agent。
- 判断标签:趋势增强
- 意味着什么:AI coding 正从小圈子扩散到普通开发者,术语解释、方法论和培训材料会变成团队推广的关键资产。
- 链接:https://github.com/mattpocock/dictionary-of-ai-coding
四、AI 热点新闻
OpenAI 发布 Windows Codex sandbox 实践
- 事件:OpenAI 介绍如何在 Windows 上构建安全有效的沙箱以启用 Codex。
- 可信度:一手发布
- 意味着什么:Codex 要进入企业桌面,Windows 沙箱是绕不开的一步。ABU9 这种传统企业环境里,Windows 兼容性比 Mac 开发体验更关键。
- 链接:https://openai.com/index/building-codex-windows-sandbox
Anthropic 发布 Claude Code auto mode 安全方案
- 事件:Anthropic Engineering 解释 Claude Code auto mode,用分类器减少审批疲劳,同时保留危险动作拦截。
- 可信度:一手发布
- 意味着什么:权限审批不是“开或关”,而会变成模型辅助风控。OpenClaw 的 approval / sandbox / prompt-injection probe 可以参考这个方向。
- 链接:https://www.anthropic.com/engineering/claude-code-auto-mode
Claude 电脑与浏览器使用最佳实践更新
- 事件:Claude Blog 发布 computer/browser use 最佳实践。
- 可信度:一手发布
- 意味着什么:浏览器 agent 的核心不是会点按钮,而是页面理解、状态恢复、权限边界和失败处理。适合纳入 OpenClaw browser skill 的长期迭代。
- 链接:https://claude.com/blog/best-practices-for-computer-and-browser-use-with-claude
腾讯开源 Agent Memory,宣称 Token 降低 61%
- 事件:腾讯开源 Agent Memory,并被报道可降低 Token 消耗。
- 可信度:媒体报道
- 意味着什么:记忆系统的卖点正在从“更懂你”转向“更便宜、更可控”。但 61% 这种量化结果需要看任务集和复现条件。
- 链接:https://www.ithome.com/0/950/415.htm
Claude Agent SDK 将给付费计划提供月度额度
- 事件:Alex Albert 称 6 月 15 日起,付费 Claude plans 会包含 Claude Agent SDK monthly credit。
- 可信度:X 传闻
- 意味着什么:模型厂商会用额度把开发者锁进自家 agent SDK。OpenClaw 要保持多模型、多 provider 抽象,避免被单一生态绑死。
- 原帖链接:https://x.com/alexalbert__/status/2054613082589298899
Claude Code 周限额提升 50%
- 事件:ClaudeDevs 发布 Claude Code weekly limits 提升消息。
- 可信度:X 传闻
- 意味着什么:AI coding 的使用强度正在超出原有订阅设计,额度、限流和企业计划会成为用户选择工具的重要因素。
- 链接:https://x.com/ClaudeDevs/status/2054639777685934564
LangSmith Sandboxes GA
- 事件:LangChain 宣布 LangSmith Sandboxes GA,提供安全、可扩展的 agent 代码执行环境。
- 可信度:一手发布
- 意味着什么:agent runtime 正在产品化。快照、fork、暂停、服务 URL、鉴权代理这些能力,会逐步成为企业 agent 平台标配。
- 链接:https://x.com/LangChainAI/status/2054705492522570074
a16z 讨论系统记录层向 headless agents 转变
- 事件:a16z 指出系统记录层 incumbents 正转向 headless agents,竞争会转向 proprietary data、action layer 和 real-world execution。
- 可信度:媒体报道
- 意味着什么:ABU9 的机会不在“再做一个台账系统”,而在把车企流程里的动作层 agent 化。
- 链接:https://x.com/a16z/status/2054685477668872612
Waymo 分享 2000 万次出行后的自动驾驶经验
- 事件:Training Data 播客采访 Waymo 的 Dmitri Dolgov,讨论 2000 万次 rides 与全自动驾驶路线。
- 可信度:一手发布
- 意味着什么:车企 AI 的护城河最终来自长期运营数据、真实安全闭环和工程体系,不是单点模型能力。
- 链接:https://www.youtube.com/playlist?list=PLOhHNjZItNnMm5tdW61JpnyxeYH5NDDx8
百度推进智能体布局,以日活为关键指标
- 事件:百度官方 X 提到智能体布局和日活指标。
- 可信度:一手发布
- 意味着什么:大厂开始用 DAU 衡量 agent,而不是只看模型榜单。企业内部 agent 也应该看使用频次、完成率、节省时间,而不是 demo 数量。
- 链接:https://x.com/Baidu_Inc/status/2054815977477738549
五、论文 / 研究 / 观点
ExploitGym:AI 智能体能否把漏洞转成真实攻击
- 事件:Berkeley RDI 讨论 ExploitGym,用于评估 AI agent 是否能把安全漏洞转化为真实攻击。
- 可信度:一手发布
- 意味着什么:安全评估会从“模型会不会说危险话”升级到“agent 能不能完成危险动作”。企业 AI 安全门槛会明显提高。
- 链接:https://rdi.berkeley.edu/blog/exploitgym
CMU:教视觉-语言模型理解电影语言
- 事件:CMU ML Blog 讨论让 VLM 理解 cinema language。
- 可信度:一手发布
- 意味着什么:多模态不只是识别画面,还要理解叙事、镜头和表达。对营销视频、展厅讲解、培训内容生成有启发。
- 链接:https://blog.ml.cmu.edu/2026/05/13/teaching-vision-language-models-to-speak-cinema
swyx:模型路由数据值得认真看
- 事件:swyx 指出 model router 公司数据能反映真实生产 AI 用法,例如 Gemini 在教育/个人助手领先、Anthropic 在 coding/spend 占优。
- 可信度:X 传闻
- 意味着什么:模型选择不应只看 benchmark,要看任务类型、价格、速度和真实生产用量。OpenClaw 的路由策略应该按任务域分层。
- 原帖链接:https://x.com/swyx/status/2054720201070190632
Sam Altman:可能需要更重视价格/速度 tradeoff
- 事件:Sam Altman 提到自己会焦虑不用最聪明模型,但有时能接受慢,思考是否应更关注价格/速度 tradeoff。
- 可信度:X 传闻
- 意味着什么:模型产品会更细分:最快、最强、最便宜不是一个维度。企业 agent 要按任务价值动态选模型。
- 原帖链接:https://x.com/sama/status/2054627102922797323
六、今天值得读 / 值得看(BestBlogs / Follow Builders 精选)
标题/核心观点:Claude Code auto mode:用模型分类器缓解审批疲劳。
为什么值得看:这是 agent 权限治理的一手设计文档,直接关系 OpenClaw 的审批、sandbox 和安全默认值。
链接:https://www.anthropic.com/engineering/claude-code-auto-mode
标题/核心观点:Claude computer/browser use 最佳实践。
为什么值得看:浏览器 agent 是企业落地入口,这篇适合拆成 OpenClaw browser-automation 的检查清单。
链接:https://claude.com/blog/best-practices-for-computer-and-browser-use-with-claude
标题/核心观点:Waymo 2000 万 rides 后的自动驾驶经验。
为什么值得看:ABU9 看车企 AI 不能只看智能座舱,要看真实运营闭环和安全工程体系。
链接:https://www.youtube.com/playlist?list=PLOhHNjZItNnMm5tdW61JpnyxeYH5NDDx8
标题/核心观点:Peter Yang:Claude Code / Codex 的低估用法是合并和编辑 PDF。
为什么值得看:企业办公里 PDF 处理是高频刚需,适合做成 OpenClaw 小 skill。
标题/核心观点:Guillermo Rauch:Notion 开发者平台建在 Vercel Sandbox 上。
为什么值得看:Notion 正变成 agent workbench,背后是可执行 sandbox,而不是传统插件市场。
标题/核心观点:Peter Steinberger:Crabbox 0.13.0 支持 modal sandbox、Windows script、workdir resync。
为什么值得看:个人开发者也在补 agent 执行环境的工程细节,说明 sandbox/runtime 是真实痛点。
标题/核心观点:Jealousy 尼卡:Codex 神级 Skill 工具清单。
为什么值得看:中文 Codex 生态正在从模型体验转向 skill 工具包,值得进入 OpenClaw skill 观察清单。
标题/核心观点:OpenSquilla:智能路由与本地检索降低 LLM 使用成本。
为什么值得看:成本治理 + 本地检索 + 路由,是企业 AI 从玩具走向生产的关键组合。
七、对我们有用的行动建议
OpenClaw 优先补“安全执行链路”。 把 approval、sandbox、prompt-injection probe、工具权限、会话恢复做成一套可解释机制,别只追新模型。
给 ABU9 做 2 个低风险 skill 原型。 一个是 PDF 合并/抽取/改写,一个是客户方案 HTML deck 生成;这两个离业务最近,最容易证明价值。
把 Codex 工具链纳入观察。 CodexPlusPlus、deepclaude、Codex skill 清单都说明 Claude Code 不是唯一入口,内部工具设计要保持 provider-neutral。
周报开始跟踪 Follow Builders 的 builders 信号。 不要逐条搬运 X,而是看 7 天内重复出现的主题:sandbox、model routing、Notion/Vercel、AI coding workflow。
车企 AI 不要只看模型发布。 Waymo 访谈应该沉淀到 ABU9 机会图:真实运营数据、安全闭环、自动化动作层,才是车企 AI 的长期资产。
八、今日结论
今天的核心不是又出了多少 AI 工具,而是 agent 正在补齐生产环境三件事:安全执行、可复用 workflow、动作层闭环。