Agent 的工程化焦点从“能调用工具”转向“能自证结果”。 Claude Connector observability、Managed Agents outcomes、guard-skills 都在补同一块短板:企业不缺演示,缺工具调用、错误、延迟、评分和复盘链路。
今日重点项目雷达
JimLiu/baoyu-design
是什么:把 Claude Design 本地化为 Agent Skill,可在 Cursor、Claude Code、Codex 等环境生成 UI mockup、原型、deck 和线框稿。;判断标签:趋势增强
Source ↗amElnagdy/guard-skills
是什么:面向 coding agent 的质量门 skill,专门捕捉 AI 生成代码、测试、文档里的常见失败模式。;判断标签:趋势增强
Source ↗nexu-io/html-anything
是什么:本地 agentic HTML editor,覆盖 magazine、deck、poster、XHS/tweet、prototype、data report、Hyperframes 等 9 类输出面。;判断标签:趋势增强
Source ↗tastyeffectco/sandboxd
是什么:自托管开发沙箱和 preview URL 工具,不依赖 Kubernetes,面向 coding agents 和 SaaS factories。;判断标签:趋势增强
Source ↗XingYu-Zhong/DeepSeek-GUI
是什么:面向 DeepSeek 模型的 AI agent workspace,内置 Code 和 Claw 模式。;判断标签:趋势增强
Source ↗safishamsi/graphify
是什么:把代码、SQL schema、脚本、文档、论文、图片、视频等转成可查询知识图谱的 AI coding assistant skill,topics 包含 OpenClaw。;判断标签:待验证
Source ↗NVIDIA/NemoClaw
是什么:声称在 NVIDIA OpenShell 内更安全地运行 Hermes、OpenClaw 等 agents,并配套 managed inference。;判断标签:待验证
Source ↗op7418/guizang-social-card-skill
是什么:Claude Code/Codex skill,用 HTML 生成小红书图文、公众号封面和社媒卡片。;判断标签:趋势增强
Source ↗ultraworkers/claw-code
是什么:声称由 agent 管理的 Rust 博物馆展项,使用 Gajae-Code / LazyCodex 且无人类干预维护。;判断标签:噪音降权
Source ↗数据来源:AI HOT + GitHub 近期爆发项目 + BestBlogs 今日精选 + Follow Builders 建造者 feed + 必要核实。筛选标准:实时性、增速、AI/Agent 相关度、对 ABU9/OpenClaw 的启发。采集时间:2026-06-08 20:00 UTC / 2026-06-09 04:00 Asia/Shanghai。
降级说明:GitHub API、AI HOT、Follow Builders 采集正常;BestBlogs 今日接口返回 success 但 data=null,因此“今天值得读 / 值得看”以 Follow Builders、Anthropic 官方源和 AI HOT 高信号内容补位;融资、benchmark、未公开模型能力均按可信度降权处理。
一、今日主线判断
Agent 的工程化焦点从“能调用工具”转向“能自证结果”。 Claude Connector observability、Managed Agents outcomes、guard-skills 都在补同一块短板:企业不缺演示,缺工具调用、错误、延迟、评分和复盘链路。
Apple、微信、NotebookLM 正把 AI 放进既有入口,而不是重新发明入口。 这对 ABU9 的启发是:汽车 AI 不一定先做新 App,更现实的是嵌入展厅、企微、小程序、DMS/CRM 等现有工作面。
模型路由开始变成企业 AI 成本控制层。 OpenRouter Advisor、Vercel AI Gateway、Aaron Levie 的分层模型观点都指向“高价值任务用 frontier,高频任务用便宜模型,并用观测层闭环”。
AI-native artifact 继续爆发,HTML/Skill 正成为交付物中间层。 baoyu-design、html-anything、html-video、PPT Skill、社媒卡片 Skill 说明 agent 产出不止代码,也在覆盖售前材料、培训、短视频和运营内容。
领域 Agent 的护城河是数据接口和确定性工具。 Anthropic 生物学 agent 研究说明,模型强不等于专业工作可靠;没有结构化检索、标准接口和评估集,Agent 会卡在领域数据基础设施里。
二、GitHub 近期爆发项目
JimLiu/baoyu-design
- 是什么:把 Claude Design 本地化为 Agent Skill,可在 Cursor、Claude Code、Codex 等环境生成 UI mockup、原型、deck 和线框稿。
- 元数据:创建 2026-06-07;stars 509;最近更新 2026-06-07;采集窗口/来源查询 new_7d_100, new_14d_200_ai_agent;age 1 天;近似速度 509.0 stars/day;7 日重复 0 次。
- 判断标签:趋势增强
- 意味着什么:Design Skill 已经从单点模板扩散到“本地可复用能力包”,OpenClaw 的 skill 体系可以把售前方案、展厅大屏、原型评审沉淀成类似可复用技能。
- 链接:https://github.com/JimLiu/baoyu-design
amElnagdy/guard-skills
- 是什么:面向 coding agent 的质量门 skill,专门捕捉 AI 生成代码、测试、文档里的常见失败模式。
- 元数据:创建 2026-06-06;stars 452;最近更新 2026-06-07;采集窗口/来源查询 new_7d_100, new_14d_200_ai_agent;age 2 天;近似速度 226.0 stars/day;7 日重复 0 次。
- 判断标签:趋势增强
- 意味着什么:Agent 规模化后,质量门会比“更会写代码”更稀缺;OpenClaw 应把日报、Wiki、代码、PPT 都纳入可执行质量门,而不是靠人工复读检查清单。
- 链接:https://github.com/amElnagdy/guard-skills
nexu-io/html-anything
- 是什么:本地 agentic HTML editor,覆盖 magazine、deck、poster、XHS/tweet、prototype、data report、Hyperframes 等 9 类输出面。
- 元数据:创建 2026-05-11;stars 6382;最近更新 2026-06-02;采集窗口/来源查询 new_30d_500_ai_agent;age 28 天;近似速度 227.93 stars/day;7 日重复 2 次。
- 判断标签:趋势增强
- 意味着什么:HTML 正在成为“可预览、可导出、可复用”的通用 artifact 层;ABU9 售前材料和客户汇报可以优先统一到 HTML/PDF/PPTX 转换链路。
- 链接:https://github.com/nexu-io/html-anything
tastyeffectco/sandboxd
- 是什么:自托管开发沙箱和 preview URL 工具,不依赖 Kubernetes,面向 coding agents 和 SaaS factories。
- 元数据:创建 2026-06-03;stars 514;最近更新 2026-06-07;采集窗口/来源查询 new_7d_100, new_14d_200_ai_agent;age 5 天;近似速度 102.8 stars/day;7 日重复 1 次。
- 判断标签:趋势增强
- 意味着什么:企业 agent 要真正交付,必须有隔离运行环境、预览链接、生命周期管理;这类项目值得作为 OpenClaw 沙箱能力对标。
- 链接:https://github.com/tastyeffectco/sandboxd
XingYu-Zhong/DeepSeek-GUI
- 是什么:面向 DeepSeek 模型的 AI agent workspace,内置 Code 和 Claw 模式。
- 元数据:创建 2026-05-21;stars 2892;最近更新 2026-06-08;采集窗口/来源查询 new_30d_500_ai_agent;age 18 天;近似速度 160.67 stars/day;7 日重复 1 次。
- 判断标签:趋势增强
- 意味着什么:国内模型生态正在把模型能力包装成“工作台 + 模式 + 工具”的产品形态,企业客户会逐渐拿它和 Claude Code/Codex 类产品横向比较。
- 链接:https://github.com/XingYu-Zhong/DeepSeek-GUI
Vercel Labs/zerolang
- 是什么:Vercel Labs 提出的“面向 agents 的编程语言”。
- 元数据:创建 2026-05-15;stars 4914;最近更新 2026-06-08;采集窗口/来源查询 new_30d_500_ai_agent;age 24 天;近似速度 204.75 stars/day;7 日重复 2 次。
- 判断标签:新变量
- 意味着什么:如果 agent 专用语言成立,未来工作流可能不是自然语言 prompt,也不是传统代码,而是可验证、可回放、可约束的 agent spec。
- 链接:https://github.com/vercel-labs/zerolang
safishamsi/graphify
- 是什么:把代码、SQL schema、脚本、文档、论文、图片、视频等转成可查询知识图谱的 AI coding assistant skill,topics 包含 OpenClaw。
- 元数据:创建 2026-04-03;stars 63242;最近更新 2026-06-08;采集窗口/来源查询 fresh_90d_active_ai_agent;age 66 天;近似速度 958.21 stars/day;7 日重复 1 次。
- 判断标签:待验证
- 意味着什么:方向强相关,但 star 规模异常高,需先复核 README、commit、issue 和真实使用案例;若成立,适合做 ABU9 项目资产和遗留系统理解层。
- 链接:https://github.com/safishamsi/graphify
NVIDIA/NemoClaw
- 是什么:声称在 NVIDIA OpenShell 内更安全地运行 Hermes、OpenClaw 等 agents,并配套 managed inference。
- 元数据:创建 2026-03-15;stars 21063;最近更新 2026-06-08;采集窗口/来源查询 fresh_90d_active_ai_agent;age 85 天;近似速度 247.8 stars/day;7 日重复 0 次。
- 判断标签:待验证
- 意味着什么:NVIDIA + OpenClaw 命名强相关,但需要确认是否为官方项目、license 和真实代码质量;暂不按官方生态看待,只列入高优先复核。
- 链接:https://github.com/NVIDIA/NemoClaw
op7418/guizang-social-card-skill
- 是什么:Claude Code/Codex skill,用 HTML 生成小红书图文、公众号封面和社媒卡片。
- 元数据:创建 2026-05-27;stars 3162;最近更新 2026-05-27;采集窗口/来源查询 new_14d_200_ai_agent, new_30d_500_ai_agent;age 12 天;近似速度 263.5 stars/day;7 日重复 2 次。
- 判断标签:趋势增强
- 意味着什么:运营内容生产开始 skill 化;ABU9 的客户案例、产品亮点、培训海报可以从“人工设计”转为“结构化内容 + skill 渲染”。
- 链接:https://github.com/op7418/guizang-social-card-skill
ultraworkers/claw-code
- 是什么:声称由 agent 管理的 Rust 博物馆展项,使用 Gajae-Code / LazyCodex 且无人类干预维护。
- 元数据:创建 2026-03-31;stars 193490;最近更新 2026-06-08;采集窗口/来源查询 fresh_90d_active_ai_agent;age 69 天;近似速度 2804.2 stars/day;7 日重复 0 次。
- 判断标签:噪音降权
- 意味着什么:star 与描述都异常,可能是排行榜噪音或营销项目;只作为“GitHub 热点异常”观察,不进入 OpenClaw 技术路线。
- 链接:https://github.com/ultraworkers/claw-code
三、最近 7 天新项目:值得点开
GordenSun/GordenSuperPPTSkills
- 是什么:AI PPT Skill,用 GPT 生成图片格式 PPT,再转换为可编辑 PPTX。
- 元数据:创建 2026-06-07;stars 360;最近更新 2026-06-07;采集窗口/来源查询 new_7d_100;age 1 天;近似速度 360.0 stars/day;7 日重复 0 次。
- 判断标签:新变量
- 意味着什么:PPT Skill 仍在高速分化,值得拿一个真实 ABU9 售前课题测试“可编辑 PPTX”的稳定性和版式质量。
- 链接:https://github.com/GordenSun/GordenSuperPPTSkills
NoopApp/noop
- 是什么:离线 WHOOP companion,蓝牙连接手环,数据保留在本地设备,无云端、账号和订阅。
- 元数据:创建 2026-06-07;stars 511;最近更新 2026-06-08;采集窗口/来源查询 new_7d_100;age 1 天;近似速度 511.0 stars/day;7 日重复 0 次。
- 判断标签:新变量
- 意味着什么:虽然不是 AI 项目,但“设备数据本地化 + 无云依赖”对车端/展厅端隐私设计有启发;可作为端侧数据产品参考。
- 链接:https://github.com/NoopApp/noop
razr001/align-dev
- 是什么:帮助 AI 辅助前端团队生成共享 coding standards 和 SKILL.md,让 Claude Code、Codex、Cursor、Copilot 输出更一致。
- 元数据:创建 2026-06-03;stars 320;最近更新 2026-06-05;采集窗口/来源查询 new_7d_100;age 5 天;近似速度 64.0 stars/day;7 日重复 0 次。
- 判断标签:趋势增强
- 意味着什么:团队级 AI 开发的关键不是“每个人会 prompt”,而是统一工程规范、设计规范和 skill;适合 ABU9 研发团队做 AI 编程规约模板。
- 链接:https://github.com/razr001/align-dev
mysk-research/loupe
- 是什么:隐私优先的 iOS App,用于展示原生 App 可见的数据范围。
- 元数据:创建 2026-06-04;stars 348;最近更新 2026-06-05;采集窗口/来源查询 new_7d_100;age 4 天;近似速度 87.0 stars/day;7 日重复 0 次。
- 判断标签:新变量
- 意味着什么:AI agent 进入手机/企业 App 后,用户会更关心“它到底看见了什么”;这类透明化工具可借鉴到企业 AI 权限说明和审计界面。
- 链接:https://github.com/mysk-research/loupe
jeff141/meatshell
- 是什么:轻量低内存 SSH / 终端客户端。
- 元数据:创建 2026-06-04;stars 421;最近更新 2026-06-08;采集窗口/来源查询 new_7d_100;age 4 天;近似速度 105.25 stars/day;7 日重复 1 次。
- 判断标签:新变量
- 意味着什么:agent 运维和远程执行需要更轻的终端会话层;可观察其会话恢复、日志留存、权限隔离是否适合 agent shell。
- 链接:https://github.com/jeff141/meatshell
zenhosta/9drive
- 是什么:把多个 Google Drive 账号聚合成一个虚拟存储仪表盘,支持配额、上传路由、虚拟文件夹和预览。
- 元数据:创建 2026-06-04;stars 444;最近更新 2026-06-05;采集窗口/来源查询 new_7d_100;age 4 天;近似速度 111.0 stars/day;7 日重复 1 次。
- 判断标签:新变量
- 意味着什么:企业 agent 需要跨网盘、跨知识库的统一文件视图;虽然项目非 AI,但对 OpenClaw 文件系统和知识库挂载有参考价值。
- 链接:https://github.com/zenhosta/9drive
cpaczek/skylight
- 是什么:通过 RTL-SDR 把头顶飞机、天空层和航向实时投影到天花板。
- 元数据:创建 2026-06-02;stars 2367;最近更新 2026-06-08;采集窗口/来源查询 new_7d_100;age 5 天;近似速度 473.4 stars/day;7 日重复 3 次。
- 判断标签:噪音降权
- 意味着什么:热度高但与 AI/Agent 主线弱,且重复出现;只保留为“GitHub 非 AI 爆款”样本,避免误入技术优先级。
- 链接:https://github.com/cpaczek/skylight
四、AI 热点新闻
Claude 为 Connector 开发者推出性能监控仪表盘
- 事件:Claude 目录中已发布 Connector 的所有者可追踪活跃用户、工具调用、目录排名、健康评分、错误率、延迟,并按工具和产品分解使用情况。
- 可信度:一手发布
- 意味着什么:MCP/Connector 的竞争会从“能接上”进入“能观测、能运营”;OpenClaw 插件生态也需要健康分、调用量、错误归因。
- 链接:https://claude.com/blog/observability-for-developers-building-connectors
Anthropic 发布“为生物学 AI Agent 铺路”研究
- 事件:Anthropic 研究显示,科研 agent 在 NCBI Virus 等生物数据库上难以稳定构建可靠数据集,引入确定性检索层 gget virus 后准确率接近 100%。
- 可信度:一手发布
- 意味着什么:专业领域 agent 要先补“确定性工具 + 标准数据接口”,再谈模型能力;汽车行业知识库也需要类似 VIN、车型、工单、配件的可靠检索层。
- 链接:https://www.anthropic.com/research/agents-in-biology
Apple 预览新一代 Apple Intelligence 与 Siri AI
- 事件:Apple 在 WWDC 2026 相关发布中预览新一代 Apple Intelligence、Siri AI 以及更多系统级 AI 能力。
- 可信度:一手发布
- 意味着什么:Apple 继续走系统入口路线,说明个人 AI 的主战场仍是 OS、App、通知、文件和设备权限,不是孤立 chatbot。
- 链接:https://www.apple.com/newsroom/2026/06/apple-unveils-next-generation-of-apple-intelligence-siri-ai-and-more
Apple Intelligence 强化日常体验
- 事件:Apple 宣布下一代 Apple Intelligence 将更深地集成 iPhone、iPad 和 Mac 的日常体验。
- 可信度:一手发布
- 意味着什么:企业 AI 产品也应减少“另开一个入口”,优先嵌入员工已经使用的系统和流程。
- 链接:https://www.apple.com/newsroom/2026/06/apple-intelligence-brings-powerful-ai-capabilities-into-everyday-experiences
Siri AI 在欧盟因 DMA 延迟上线
- 事件:Apple 称受欧盟 DMA 影响,Siri AI 在欧盟将随 iOS 27/iPadOS 27 延迟上线,具体时间未公布。
- 可信度:一手发布
- 意味着什么:AI 入口越深,监管、互操作和平台规则越会影响发布时间;ABU9 做企业 AI 也要提前设计数据授权和合规边界。
- 链接:https://www.apple.com/newsroom/2026/06/due-to-dma-siri-ai-delayed-in-eu-for-ios-27-and-ipados-27
NotebookLM 升级 agentic capabilities 与高级推理
- 事件:NotebookLM 官方称推出更强版本,增加对话中的智能体能力、高级推理和更多输出格式,面向 Google AI Ultra 用户开放。
- 可信度:一手发布
- 意味着什么:知识库产品正在从“问答”变成“研究任务执行 + 多格式输出”;OpenClaw 的 Wiki 和日报也应向任务化研究流靠拢。
- 链接:https://x.com/NotebookLM/status/2064016460964585549
ChatGPT 新增数据图表生成功能
- 事件:ChatGPT 官方称已支持在移动端和网页端直接把数据与比较转成图表。
- 可信度:一手发布
- 意味着什么:通用助手继续吃掉轻量 BI 和汇报图表场景;ABU9 内部经营分析可先用“数据表 + chart artifact”做低成本验证。
- 链接:https://x.com/ChatGPTapp/status/2064018770839113769
OpenRouter 发布 Advisor server tool
- 事件:OpenRouter 称 Advisor 可让小模型向更高智能模型咨询,用于逃出困境循环并迁移到更便宜模型。
- 可信度:一手发布
- 意味着什么:这是模型路由从“静态选择模型”走向“运行时求助机制”;适合 OpenClaw 设计 cheap model + expert model 的分层调度。
- 链接:https://x.com/OpenRouter/status/2064004944613527730
Hivemind 发布 coding agents 持续学习能力
- 事件:Hivemind 称可收集团队中 Claude Code、Codex、Cursor、Hermes、Pi 的轨迹,转为可复用技能并推送到所有 agent;其准确率提升数据属官方/作者自述,需第三方验证。
- 可信度:X 传闻
- 意味着什么:方向和 OpenClaw 记忆/skill 体系高度相关,但 benchmark 不能直接采信;可关注其“轨迹到 skill”的抽取方式。
- 链接:https://x.com/kimmonismus/status/2064001045391462907
Perplexity 与哈佛研究称 AI Agent 提效 87%、降本 94%
- 事件:Perplexity 称与哈佛研究从搜索界面转向自主 agent,使用 Computer 的工人完成任务更快、成本更低、满意度更高;量化结论需第三方复核。
- 可信度:X 传闻
- 意味着什么:自主 agent 的 ROI 叙事正在强化,但企业采购不能只看厂商数字,必须建立自己的任务集和成本口径。
- 链接:https://x.com/perplexity_ai/status/2064023455453110286
微信 AI Agent 生态曝光与官方接入指引
- 事件:微信 AI 正在内测,小程序可通过自动模式或开发模式接入;另有媒体称微信与手机厂商合作 A2A 助手能力。
- 可信度:媒体报道
- 意味着什么:微信可能成为国内 Agentic Commerce 的关键入口;汽车经销商小程序、服务预约、试驾、售后工单值得提前评估 AI 可调用改造。
- 链接:https://www.ithome.com/0/961/480.htm
Hugging Face 宣布 OpenEnv 获开源社区支持
- 事件:OpenEnv 定位为 agentic RL 环境互操作层,支持终端、浏览器等环境的发布、部署和消费,并把 MCP 作为一等公民。
- 可信度:一手发布
- 意味着什么:Agent 训练和评估正在走向标准环境;OpenClaw 的浏览器/终端任务如果能被标准化为环境,将更容易评估和复现。
- 链接:https://huggingface.co/blog/openenv-agentic-rl
五、论文 / 研究 / 观点
Anthropic:生物学数据库不是为 agent 设计的。 核心观点是领域数据接口决定 agent 上限;工程实践是增加确定性检索层;对 OpenClaw/ABU9 的启发是先把业务系统做成 agent-ready API,再谈自动化。链接:https://www.anthropic.com/research/agents-in-biology
Dwarkesh:样本效率黑洞。 大模型能力背后的瓶颈仍是高质量数据,尤其是高经济价值任务数据;这解释了为什么软件工程 agent 先成熟,而大量知识工作还没到临界点。链接:https://www.dwarkesh.com/p/the-sample-efficiency-black-hole
Aaron Levie:企业 AI 不是只靠更会写软件。 企业软件难点会转向 GTM、咨询式销售、实施、集成和差异化,AI 反而让买方更需要可信服务方。链接:https://x.com/levie/status/2063756386572681606
Aaron Levie:模型家族会分层,路由层会变贵。 高端任务继续用 frontier,高频工作负载会下沉到便宜模型,能在成功率和成本之间动态调度的层会更有价值。链接:https://x.com/levie/status/2063835799096090749
Hugging Face 多模型经济体实验:涌现行为不稳健。 多模型 agent 市场未能复现此前单模型崩溃,说明生产系统不能赌“涌现”,必须有确定性控制和结算规则。链接:https://huggingface.co/blog/build-small-hackathon/thousand-token-wood-sim-v3
六、今天值得读 / 值得看(BestBlogs / Follow Builders 精选)
标题/核心观点:Claude Managed Agents 新增 dreaming、outcomes、多 agent orchestration。
- 为什么值得看:这是今天最值得看的一手工程材料,dreaming 对应跨会话记忆整理,outcomes 对应质量门,多 agent orchestration 对应复杂任务并行。
- 原文链接:https://claude.com/blog/new-in-claude-managed-agents
标题/核心观点:Boris Cherny 总结 Opus 长时间自主运行的 5 个做法。
- 为什么值得看:关键不在 prompt,而在 auto permission、dynamic workflows、/goal 或 /loop、云端运行、端到端自验证。
- 原帖链接:https://x.com/bcherny/status/2063792263067754658
标题/核心观点:Vercel AI Gateway 每月通过智能重试恢复超过 1T tokens。
- 为什么值得看:AI Gateway 正从“统一转发”变成可靠性、观测、预算和零数据保留的基础设施层。
- 原帖链接:https://x.com/rauchg/status/2063714700618334260
标题/核心观点:领域训练数据不是低技能标注,而是高价值任务知识。
- 为什么值得看:这解释了为什么 ABU9 的汽车业务知识、交付经验、流程细节可能是企业 AI 的真实护城河。
- 原帖链接:https://x.com/realmadhuguru/status/2063704354910347520
标题/核心观点:不要再“提示”coding agents,要设计能提示 agent 的 loops。
- 为什么值得看:OpenClaw 的方向应从单次对话升级为循环、质量门、复盘和自动重试。
- 原帖链接:https://x.com/steipete/status/2063697162748260627
标题/核心观点:Box Markdown editor + CLI + 版本历史 + mounted drive。
- 为什么值得看:企业文件系统正在变成 Claude Cowork、Codex、Obsidian、Cursor 可直接工作的底座;这对 ABU9 文档资产治理有现实意义。
- 原帖链接:https://x.com/levie/status/2063649508681224367
标题/核心观点:AI 工具教育已经成为严肃瓶颈。
- 为什么值得看:企业 AI 落地不只是买工具,还要形成模板、教程、案例、复盘和内部教练机制。
- 原帖链接:https://x.com/garrytan/status/2063786111588323780
标题/核心观点:State of Enterprise AI 2026 访谈 Aaron Levie。
- 为什么值得看:访谈把 token 成本、headless software、企业变更管理和 AI rollout 节奏讲得很完整,适合作为企业 AI 落地背景材料。
- 链接:https://www.youtube.com/watch?v=Gs2styCcwro
七、对我们有用的行动建议
给 OpenClaw 建一个“结果自证”标准件。 把 outcomes 思路落成日报、代码、PPT、HTML、Wiki 的统一质量门:输入标准、评分 rubric、失败重试、可追溯证据。
ABU9 先选一个高价值业务数据接口做 agent-ready 改造。 例如试驾线索、工单、车型配置、经销商知识库;目标不是聊天,而是确定性检索 + 可执行动作。
建立模型路由小实验。 选择 3 类任务:日报摘要、代码检查、售前方案;分别用便宜模型、frontier 模型、Advisor/专家模型组合,记录成本、成功率和人工返工。
把售前交付物统一到 HTML artifact 管线。 先用 baoyu-design、html-anything、PPT Skill 做一个“汽车客户 AI 方案包”,输出 HTML、PPTX、PNG、MP4 四种形态。
对 GitHub 异常高 star 项目执行噪音复核。 graphify、NemoClaw、claw-code 等强相关但异常项目只进入 watchlist,不进入实施路线,复核 README、commit、license、issue 后再定级。
八、今日结论
今天的核心变化不是又多了几个模型或产品,而是 Agent 正在补齐企业化必需的三件事:可观测、可验证、可复用。