# AI 世界月报｜2026-06

> 覆盖窗口：2026-06-01 至 2026-06-30（Asia/Shanghai）。生成时间：2026-07-01 08:00。  
> 主要输入：LLM Wiki `syntheses/ai-world-current-map.md`、`syntheses/ai-agent-infra-watch.md`、`syntheses/ai-world-daily-log.md`、`syntheses/ai-x-intel-signal-log.md`、`syntheses/ai-world-weekly-log.md`，以及本地 `reports/ai-world-daily-2026-06-*.md`、`reports/ai-world-weekly-2026-27.md`。  
> 降级说明：OpenClaw Wiki API `wiki_get/wiki_search` 本次返回 `Maximum call stack size exceeded`，已读取本地 Wiki vault 文件与 reports 兜底；BestBlogs 在多期日报中返回 `success=true,data=null`，月报不把缺失数据伪造成精选；GitHub 高 star 项目按异常/待验证分层处理。  
> 可信度规则：一手发布 / 媒体报道 / X 传闻 / 待核实分层；官方自称 benchmark、成本、排名、速度提升仍需第三方验证。

## 一、月度总判断

**6 月 AI 世界的结构性迁移是：从“模型能力竞赛”转向“可治理 Agent 生产系统”。**

过去 30 天的高信号不再集中于某个模型参数领先，而是集中在 9 个生产系统组件：Agent runtime、协作工位、artifact 交付、模型路由、eval、memory/knowledge graph、connector/MCP、权限/沙箱、安全审计。对企业侧来说，AI 正从“一个更聪明的聊天入口”迁移为“可委派、可审计、可回写、可复测、可计费的业务执行层”。

月度结论可以压缩成三句话：

1. **Agent 的价值层上移到组织工作流。** Claude Code artifacts、Cursor iOS、OpenTag、AgentSpace、Vercel Eve、Adrafinil 这类信号说明，Agent 正在从单人 IDE 助手变成团队可派工、可共享状态、可交付 artifact 的工作实体。  
   来源：https://claude.com/blog/artifacts-in-claude-code ｜ https://cursor.com/blog/ios-mobile-app ｜ https://github.com/amplifthq/opentag ｜ https://github.com/HKUDS/AgentSpace ｜ https://github.com/vercel/eve

2. **企业 AI 架构层正在形成。** 模型路由、成本账本、权限治理、连接器、eval、沙箱和记忆系统变成基础设施，而不是外围功能。  
   来源：https://github.com/itsthelore/wayfinder-router ｜ https://github.com/deepseek-ai/DeepSpec ｜ https://mistral.ai/news/more-control-over-connectors ｜ https://developers.googleblog.com/build-cross-language-multi-agent-team-with-google-agent-development-kit-and-a2a ｜ https://cursor.com/blog/reward-hacking-coding-benchmarks

3. **最可落地的企业 AI 形态是“行业 Skill + Artifact + Eval”。** 设计/PPT/视频/security/loop skills 的集中爆发，说明企业买的不是通用回答，而是能反复产出方案、审计、报告、话术、培训素材和流程检查的资产包。  
   来源：https://github.com/JimLiu/baoyu-design ｜ https://github.com/BuilderIO/skills ｜ https://github.com/cloudflare/security-audit-skill ｜ https://github.com/Forward-Future/loopy ｜ https://github.com/Pluviobyte/video-production-skills

## 二、过去 30 天的结构性迁移

### 1. 从模型单点能力迁移到 Agent runtime

6 月的关键变化不是“哪个模型最强”，而是 Agent 需要自己的运行时：任务状态、shell 权限、浏览器/CDP、文件系统、上下文裁剪、日志、回放、恢复、成本、人工确认。Claude Code、Cursor、Vercel Eve、browser-harness、Wayfinder Router、Adrafinil 等共同证明：生产 Agent 的瓶颈是系统工程，不是 prompt。

影响等级：高。  
可信度：高，一手发布和 GitHub 项目交叉印证。  
关键来源：https://claude.com/blog/artifacts-in-claude-code ｜ https://github.com/vercel/eve ｜ https://github.com/browser-use/browser-harness ｜ https://github.com/kageroumado/adrafinil

### 2. 从聊天入口迁移到协作工位

Agent 开始进入 Slack/GitHub、移动端、状态栏、共享 workspace、团队 artifact。OpenTag 把 `@agent` 路由到 Codex/Claude Code 并回写线程；Cursor iOS 把云端 Agent 派工和状态通知移动化；Claude Code artifacts 把结果变成可共享页面。这意味着企业 Agent 未来不会只有一个“聊天窗口”，而会嵌入工单、CRM、Issue、飞书/Slack、审批和交付平台。

影响等级：高。  
可信度：中高到高；协作产品仍需验证权限边界。  
关键来源：https://github.com/amplifthq/opentag ｜ https://cursor.com/blog/ios-mobile-app ｜ https://claude.com/blog/artifacts-in-claude-code

### 3. 从答案迁移到 Artifact 交付物

6 月 GitHub 高信号里，HTML/PPT/design/video/Lottie/architecture diagram 持续出现：`baoyu-design`、`GordenSuperPPTSkills`、`video-production-skills`、`diffusionstudio/lottie`、`lanshu-animated-architecture-diagram`。这说明企业客户真正愿意付钱的不是“AI 说了什么”，而是“AI 交付了一个可看、可改、可审、可导出的业务资产”。

影响等级：高。  
可信度：中高；输出质量、版权、品牌一致性需实测。  
关键来源：https://github.com/JimLiu/baoyu-design ｜ https://github.com/GordenSun/GordenSuperPPTSkills ｜ https://github.com/Pluviobyte/video-production-skills ｜ https://github.com/diffusionstudio/lottie

### 4. 从模型选择迁移到模型路由和成本账本

Wayfinder Router、DeepSeek DeepSpec、X 上关于分阶段模型路由、Simon Willison tokenizer 成本测算、OpenRouter/MCP 信号都说明：企业 AI 的下一层不是“选一个默认模型”，而是按任务类型、风险、上下文长度、语言、延迟、成本、成功率、人工返工率做路由。模型成本比较不能只看百万 token 标价，还要看 tokenizer、缓存、上下文裁剪和失败尾部。

影响等级：高。  
可信度：中高；成本数字需在真实业务样本复测。  
关键来源：https://github.com/itsthelore/wayfinder-router ｜ https://github.com/deepseek-ai/DeepSpec ｜ https://x.com/geekbb/status/2071128383367610437 ｜ https://x.com/simonw/status/2072068898648949184

### 5. 从“评最终答案”迁移到 trace/eval/反作弊

Cursor reward hacking、Google Jules insight strategy、benchflow awesome-evals、LangChain 生产 trace judge、BINEVAL 原子化判断都指向同一件事：Agent 评测必须看过程、证据、约束、预算、工具调用和用户感知错误。公开 benchmark 容易被污染，企业要建立自己的真实任务 eval set。

影响等级：高。  
可信度：高。  
关键来源：https://cursor.com/blog/reward-hacking-coding-benchmarks ｜ https://developers.googleblog.com/measuring-what-matters-with-jules ｜ https://github.com/benchflow-ai/awesome-evals ｜ https://x.com/LangChainAI/status/2069404292801298786 ｜ https://x.com/omarsar0/status/2070942495832470001

### 6. 从向量检索迁移到证据链记忆和知识图谱

Graphify、MemPalace、recall、second-brain MCP、X 上关于文档解析和个人记忆的讨论说明：企业知识库不会停留在 embedding 检索。更重要的是 raw evidence、episode、claim、schema、权限、版本和可清理机制。文档解析也不再是单一 OCR 精度问题，而是按合规高精度、低成本批量摄入、低延迟 Agent loop 拆成三条成本曲线。

影响等级：高。  
可信度：中高；具体项目 star 与 benchmark 需复核。  
关键来源：https://github.com/safishamsi/graphify ｜ https://github.com/MemPalace/mempalace ｜ https://x.com/jerryjliu0/status/2072035931050426782

### 7. 从泛助手迁移到行业工作流层

法律、金融、汽车、门店、售后、调度、广告本地化、文档处理等信号变强。Perplexity legal agent、Runway 广告本地化 Recipe、Claude for legal、汽车 skill suite、Probook dispatch 案例都说明，垂直 AI 不能从外围聊天开始，而要卡住利润、履约、合规、交付的主流程。

影响等级：高。  
可信度：中高；行业案例里的融资、客户数字需要核验。  
关键来源：https://github.com/anthropics/claude-for-legal ｜ https://github.com/jherrodthomas/automotive-skills-suite ｜ https://x.com/runwayml/status/2070855164584726791 ｜ https://x.com/a16z/status/2069414574999343501

## 三、确定性增强的判断

### 判断 A：Agent runtime 是企业 AI 的核心基础设施

确定性：增强。  
影响等级：高。  
理由：一个月内多个独立来源都指向沙箱、权限、状态、artifact、长任务、移动审批、协作入口、浏览器调试。它不是单一厂商叙事。  
应对：OpenClaw 要把 runtime schema 做成主线：task、state、artifact、tool trace、permission、cost、eval、human approval。

### 判断 B：Artifact 会成为企业 AI 最快收 ROI 的交付形态

确定性：增强。  
影响等级：高。  
理由：设计、PPT、HTML、视频、Lottie、架构图、release checklist、PR walkthrough 都在被 Agent 化。企业客户更容易评审 artifact，而不是评审聊天过程。  
应对：ABU9 所有 AI 产品 demo 都应默认输出 HTML/PPT/checklist/report，而不是只输出聊天文本。

### 判断 C：模型路由会变成企业 AI 标配

确定性：增强。  
影响等级：高。  
理由：成本、延迟、tokenizer、缓存、上下文、国产/开源替代和云市场采购共同推动多模型架构。Claude 进入 Microsoft Foundry 也说明企业模型接入会走云治理与采购链。  
来源：https://claude.com/blog/claude-in-microsoft-foundry

### 判断 D：Eval/trace 是 Agent 产品化的护城河

确定性：增强。  
影响等级：高。  
理由：AI 生成越多，review、reward hacking、生产 trace、用户感知错误、原子化 judge 越重要。没有 eval，Agent 只会变成不可控自动化。  
应对：ABU9 先做 30 个真实任务 eval，而不是继续堆 demo。

### 判断 E：Skill 是软件资产，不是提示词收藏

确定性：增强，但治理要求同步增强。  
影响等级：中高。  
理由：BuilderIO/skills、Cloudflare security-audit-skill、baoyu-design、loopy、video-production-skills 证明 skill 正在产品化；但 X 信号也提示 skill 不是越多越好，过期 skill 会反过来污染模型判断。  
来源：https://github.com/BuilderIO/skills ｜ https://github.com/cloudflare/security-audit-skill ｜ https://x.com/vikingmute/status/2069416335902491014

## 四、确定性减弱或被证伪的判断

### 判断 1：纯聊天助手可以承载企业 AI 主价值

确定性：减弱。  
理由：6 月高信号几乎都围绕 runtime、artifact、router、eval、connectors、workspace。聊天仍是入口之一，但不是价值闭环。  
结论：降权。ABU9 不应把“汽车销售 Chatbot”作为主产品叙事，应改成“销售/售后/交付工作流 Agent”。

### 判断 2：单一最强模型可以解决大部分企业落地问题

确定性：减弱。  
理由：模型能力仍重要，但成本、权限、上下文、工具状态、私域数据、eval、云采购、合规边界共同决定能否上线。  
结论：降权。架构必须 provider-neutral，保留 Claude/OpenAI/Gemini/Qwen/DeepSeek/本地模型的替换和路由能力。

### 判断 3：多 Agent 工作流能弥补底层模型能力短板

确定性：减弱。  
理由：X 上关于翻译/写作的反例提示，复杂流程可降遗漏、控步骤，但不能凭空制造语言质感和审美上限。  
来源：https://x.com/dotey/status/2068709091501838520  
结论：在高语言质感、高品牌要求场景，强模型仍应承担关键环节；workflow 负责证据、复核和交付格式。

### 判断 4：高 star 新项目可作为技术选型依据

确定性：被进一步证伪。  
理由：6 月多次出现异常 star、缺描述、非 AI、web3/交易/破解/逆向 API 项目。  
结论：GitHub star 只作市场温度，不作选型。必须看 README、license、近 7 天 commit、issue、可运行 demo、权限风险和真实业务映射。

### 判断 5：“零人工全自动经营/白领替代”可以近期承诺

确定性：减弱。  
理由：CEO-Bench、文明 VI 测试、长期 Agent 讨论都显示长期目标、状态感知、执行纪律仍弱。  
来源：https://the-decoder.com/only-three-ai-models-finished-above-starting-capital-in-a-500-day-startup-survival-test ｜ https://www.ithome.com/0/969/570.htm  
结论：不要卖无人值守经营；卖“有审计、有确认点、有回滚的子流程自动化”。

## 五、值得下注的方向

### 1. Agent Runtime / Workflow OS

下注等级：高。  
适合 OpenClaw：非常适合。  
理由：OpenClaw 已有 cron、sessions、skills、wiki、memory、tools，天然能包装为可治理 Agent runtime。  
下注动作：做 task state schema、artifact registry、cost ledger、permission gate、trace replay、eval runner。

### 2. 汽车行业 Skill + Artifact 包

下注等级：高。  
适合 ABU9：非常适合。  
理由：ABU9 有行业知识、客户场景和交付经验；客户更愿意买可落地的售前方案、门店话术、交付审计、售后工单复盘，而不是泛 AI 平台。  
下注动作：先做 5 个 v0 skill：售前方案生成、门店销售话术/车型知识、交付验收审计、售后工单复盘、法规/隐私检查。

### 3. Eval / Trace / 交付审计

下注等级：高。  
适合 ABU9/OpenClaw：高。  
理由：AI 产出越多，客户越关心可信、合规、可追责。交付审计是 ABU9 从服务转产品的机会。  
下注动作：建立 30 个汽车数字化真实任务 eval set，按事实正确、流程合规、引用完整、语气适配、下一步建议、成本、耗时打分。

### 4. 模型路由与成本账本

下注等级：高。  
适合 OpenClaw：高。  
理由：企业 AI 规模化后，成本和稳定性会比 demo 能力更关键。  
下注动作：OpenClaw 增加 per-task ledger：模型、输入长度、实际 token、缓存命中、延迟、成本、成功率、人工返工率、失败原因。

### 5. 文档解析路由和证据链知识库

下注等级：中高。  
适合 ABU9：高。  
理由：汽车行业合同、维修手册、售后工单、索赔资料、车型配置、培训资料差异很大，单一 OCR/RAG 管线浪费钱且不可靠。  
下注动作：按高精度合规解析、低成本批量摄入、低延迟 Agent loop 三类建立 parse router；所有输出保留字段级证据。

### 6. Browser / Computer Use for Legacy Systems

下注等级：中高。  
适合 ABU9：中高。  
理由：车企和经销商系统里大量遗留 GUI 没有好 API。Computer Use 可降低集成门槛，但安全和回滚要求高。  
下注动作：先做只读巡检、截图取证、价格/库存/流程核验，不直接做高风险写操作。

## 六、应降权或放弃的方向

1. **纯 Prompt 库。** 没有工具、数据、质量门、失败处理和权限边界的 prompt 收藏，复利弱。应转为可测试 skill，否则降权。

2. **通用聊天壳。** 客户不会长期为“更会聊”付钱。必须绑定业务流程、交付物、回写和审计。

3. **异常 star 项目追热点。** Ponytail、Graphify、MemPalace、career-ops、openclaude 等可观察，但不能只凭 star 进入技术栈。

4. **无人监督高风险自动化。** 经营决策、客户外发、代码执行、第三方仓库 setup、军事/安全/合规类任务必须有人类确认和证据链。

5. **模型榜单驱动采购。** Benchmark、融资、估值、未公开模型能力、X 私测都不应直接影响 ABU9/OpenClaw 架构选择。

## 七、长期跟踪清单

### 项目

1. **vercel/eve**  
   类别：Agent framework/runtime。影响：高。可信度：中高。  
   跟踪理由：Vercel 把 agent framework、harness、sandbox、workflow 打包，和 OpenClaw runtime 方向重合。  
   链接：https://github.com/vercel/eve

2. **amplifthq/opentag**  
   类别：协作入口 / @agent routing。影响：中高。可信度：中高。  
   跟踪理由：Agent 进入 Slack/GitHub 是企业落地必经路径。  
   链接：https://github.com/amplifthq/opentag

3. **browser-use/browser-harness**  
   类别：浏览器 Agent harness。影响：高。可信度：高。  
   跟踪理由：遗留系统和网页流程自动化的关键底座。  
   链接：https://github.com/browser-use/browser-harness

4. **itsthelore/wayfinder-router**  
   类别：模型路由。影响：高。可信度：中高。  
   跟踪理由：低延迟路由适合 OpenClaw task router 的第一版。  
   链接：https://github.com/itsthelore/wayfinder-router

5. **deepseek-ai/DeepSpec**  
   类别：投机解码 / 推理成本优化。影响：中高。可信度：中高；量化数据待复测。  
   跟踪理由：模型路由之外，推理层优化会改变成本曲线。  
   链接：https://github.com/deepseek-ai/DeepSpec

6. **benchflow-ai/awesome-evals**  
   类别：Agent eval 资源。影响：中高。可信度：中高。  
   跟踪理由：可转化为 ABU9/OpenClaw eval set 方法库。  
   链接：https://github.com/benchflow-ai/awesome-evals

7. **cloudflare/security-audit-skill**  
   类别：安全审计 skill。影响：高。可信度：高。  
   跟踪理由：结构化发现、证据链、机器可读输出，可迁移到交付审计。  
   链接：https://github.com/cloudflare/security-audit-skill

8. **JimLiu/baoyu-design**  
   类别：设计/方案 artifact skill。影响：中高。可信度：中高。  
   跟踪理由：ABU9 售前方案、展厅 demo、客户汇报可直接借鉴。  
   链接：https://github.com/JimLiu/baoyu-design

9. **Forward-Future/loopy**  
   类别：Agent loop / workflow skill。影响：中高。可信度：中。  
   跟踪理由：把可重复工作从 prompt 迁移为 loop，适合 OpenClaw cron/skill 治理。  
   链接：https://github.com/Forward-Future/loopy

10. **QwenLM/Qwen-AgentWorld**  
    类别：Agent world model / simulation。影响：中高。可信度：待验证。  
    跟踪理由：如果能模拟业务环境，可降低 agent 训练和评测成本；需看论文和可复现 demo。  
    链接：https://github.com/QwenLM/Qwen-AgentWorld

11. **XiaomiMiMo/MiMo-Code**  
    类别：国产 coding/agent 项目。影响：中高。可信度：中高；benchmark 待复测。  
    跟踪理由：国内厂商把模型和 agent 工作流联合演进，适合 ABU9 国产化路线观察。  
    链接：https://github.com/XiaomiMiMo/MiMo-Code

12. **safishamsi/graphify / MemPalace/mempalace**  
    类别：知识图谱 / 记忆系统。影响：中高。可信度：中；star 与 benchmark 需谨慎。  
    跟踪理由：方向重要，但不能直接采信项目方宣传。  
    链接：https://github.com/safishamsi/graphify ｜ https://github.com/MemPalace/mempalace

### 公司 / 机构

1. **Anthropic / Claude Code**  
   影响：高。可信度：高。  
   跟踪理由：企业 Agent 工程实践、Claude Code artifacts、Microsoft Foundry、MCP/权限治理持续领先。  
   链接：https://claude.com/blog/artifacts-in-claude-code ｜ https://claude.com/blog/claude-in-microsoft-foundry

2. **OpenAI / Codex**  
   影响：高。可信度：高。  
   跟踪理由：Codex 正从 coding tool 走向产品巡检、测试、移动派工和组织流程。  
   链接：https://openai.com/index/mapping-ai-jobs-transition-eu

3. **Google / Gemini / ADK / Jules**  
   影响：高。可信度：高。  
   跟踪理由：Computer Use、ADK+A2A、Jules insight strategy 代表 agent 工程化和评测路线。  
   链接：https://developers.googleblog.com/build-cross-language-multi-agent-team-with-google-agent-development-kit-and-a2a ｜ https://developers.googleblog.com/measuring-what-matters-with-jules

4. **Cursor**  
   影响：高。可信度：高。  
   跟踪理由：iOS、Notion SDK、reward hacking 审计共同说明 Cursor 在工作流入口和 eval 侧都值得跟。  
   链接：https://cursor.com/blog/ios-mobile-app ｜ https://cursor.com/blog/notion ｜ https://cursor.com/blog/reward-hacking-coding-benchmarks

5. **Mistral**  
   影响：中高。可信度：高。  
   跟踪理由：Connectors 权限与调试是企业 AI 连接层关键能力。  
   链接：https://mistral.ai/news/more-control-over-connectors

6. **DeepSeek / Qwen / XiaomiMiMo**  
   影响：中高。可信度：中高。  
   跟踪理由：国产/开源模型和 agent 工具会影响 ABU9 私有化、成本和合规架构。

7. **Runway**  
   影响：中。可信度：高。  
   跟踪理由：广告本地化 Recipe 指向营销 artifact API 化。  
   链接：https://x.com/runwayml/status/2070855164584726791

8. **xAI / Elon Musk**  
   影响：中高。可信度：低到中。  
   跟踪理由：Grok 4.5 私测、SpaceX/Tesla 闭环值得观察，但当前多为 X 传闻，不作事实采用。  
   链接：https://x.com/elonmusk/status/2071184354756477041

### 人物 / 观点源

1. **Jerry Liu / LlamaIndex**  
   影响：高。可信度：高。  
   跟踪理由：文档解析、Agent interface、goal/eval 工程判断对企业 AI 直接有用。  
   链接：https://x.com/jerryjliu0/status/2072035931050426782 ｜ https://x.com/jerryjliu0/status/2070909551365464500

2. **Harrison Chase / LangChain**  
   影响：高。可信度：中高。  
   跟踪理由：模型切换、trace/eval、生产 Agent 质量闭环是 OpenClaw 必跟方向。  
   链接：https://x.com/hwchase17/status/2071236031836504337 ｜ https://x.com/LangChainAI/status/2069404292801298786

3. **Simon Willison**  
   影响：中高。可信度：高。  
   跟踪理由：模型成本、tokenizer、实测方法论可信，适合模型路由账本。  
   链接：https://x.com/simonw/status/2072068898648949184

4. **Peter Yang**  
   影响：中高。可信度：中高。  
   跟踪理由：产品团队如何用 Agent、浏览器 Agent 和企业场景观点有启发。  
   链接：https://x.com/petergyang/status/2071292628302434361

5. **Omar Sar / DAIR.AI**  
   影响：中高。可信度：中高。  
   跟踪理由：MCP taxonomy、LLM-as-Judge、agent 论文信号密度高。  
   链接：https://x.com/omarsar0/status/2072076720367341933

6. **Clement Delangue / Hugging Face**  
   影响：中高。可信度：中高。  
   跟踪理由：开源生态、模型供应链、成本管理和政策风险。  
   链接：https://x.com/ClementDelangue/status/2071250272177770918

## 八、可信度分层：本月重要事件

### 一手发布

- Claude Code artifacts：Agent 输出团队可共享、可版本化页面。链接：https://claude.com/blog/artifacts-in-claude-code
- Claude in Microsoft Foundry：Claude 进入 Azure 企业治理和采购体系。链接：https://claude.com/blog/claude-in-microsoft-foundry
- Cursor iOS 公测：云端 Agent 派工、通知、远程控制进入移动端。链接：https://cursor.com/blog/ios-mobile-app
- Cursor reward hacking 审计：公开 coding benchmark 存在污染与奖励漏洞。链接：https://cursor.com/blog/reward-hacking-coding-benchmarks
- Google ADK + A2A：跨语言多智能体企业样板。链接：https://developers.googleblog.com/build-cross-language-multi-agent-team-with-google-agent-development-kit-and-a2a
- Google Jules insight strategy：coding agent 评测从最终结果转向主动发现问题。链接：https://developers.googleblog.com/measuring-what-matters-with-jules
- Mistral Connectors：企业连接器权限和调试增强。链接：https://mistral.ai/news/more-control-over-connectors
- Runway 广告本地化 Recipe：营销素材本地化 API 化。链接：https://x.com/runwayml/status/2070855164584726791

### 媒体报道

- Claude Code 第三方仓库执行风险：恶意 repo setup 可诱导 AI coding tool 执行隐藏命令。链接：https://the-decoder.com/claude-code-runs-a-github-repos-hidden-malware-without-verification-giving-attackers-full-control
- 美军 AI 目标选择事故报道：提醒数据链、审批链、责任链比模型能力更关键。链接：https://the-decoder.com/the-us-military-used-ai-to-pick-thousands-of-targets-but-missed-a-note-saying-one-was-a-school
- CEO-Bench 长期创业模拟：长期经营 Agent 短板仍明显。链接：https://the-decoder.com/only-three-ai-models-finished-above-starting-capital-in-a-500-day-startup-survival-test
- VibeThinker-3B：小模型推理能力与事实知识可能分化，benchmark 待核实。链接：https://the-decoder.com/sinas-open-model-vibethinker-3b-shows-reasoning-can-compress-but-factual-knowledge-cant/
- 微信小微灰度：入口级 Agent 在微信生态的权限和确认机制值得观察。链接：https://mp.weixin.qq.com/s/qVdfx01e9C9r5mGi0jh2BA

### X 传闻 / 待核实

- Grok 4.5 在 SpaceX/Tesla 私测：只作为 xAI 产品节奏观察，不作为模型能力事实。链接：https://x.com/elonmusk/status/2071184354756477041
- SpaceXAI 商标与 xAI 合并说法：待核实。链接：https://x.com/cb_doge/status/2070973276562530507
- SpaceX/Tesla/Cursor 数据进入 Grok 训练的推论：涉及重大事实断言，只作为数据边界风险提醒。链接：https://x.com/aaditsh/status/2071226877520261579
- AI 原生 ERP 消灭月底冲刺：方向有启发，样本和指标待核验。链接：https://x.com/FinanceYF5/status/2071054421719646511
- 免费高质量模型压缩闭源利润：战略推演，不是已发生事实。链接：https://x.com/pmarca/status/2071357787184234868

## 九、对 ABU9 的月度策略建议

### 1. 从“AI 助手”改口径为“汽车行业工作流 Agent”

不要主推通用 Chatbot。ABU9 的产品化方向应是：线索分配、试驾排程、销售话术、车型知识、门店日报、售后工单复盘、维修资料解析、交付审计、客户方案生成。每个方向都要有输入、输出 artifact、证据链、人工确认点和指标。

### 2. 先做 5 个汽车 Skill v0，不做 30 个 demo

建议 7 月只做五件事：

- 售前方案生成 Skill：输入客户行业/车型/系统现状，输出 HTML/PPT 方案和引用清单。
- 门店销售话术 Skill：输入车型、客户画像、竞品，输出可审阅话术和禁用表达。
- 交付验收审计 Skill：输入需求、代码/配置、测试记录，输出审计清单和风险等级。
- 售后工单复盘 Skill：输入工单、维修记录、客户反馈，输出原因、责任、改进动作。
- 汽车法规/隐私检查 Skill：输入方案或流程，输出合规风险和需人工确认项。

### 3. 建立 ABU9 AI Eval Set

先做 30 个真实样本：10 个售前方案、10 个交付审计、10 个门店/售后问答。每次模型、prompt、skill、router 更新都跑一遍，记录事实正确、流程合规、引用完整、客户语气、下一步建议、成本、耗时、人工返工率。

### 4. 交付审计产品化

ABU9 的历史优势是行业交付经验。AI 时代应把交付经验变成审计产品：需求一致性、配置差异、接口风险、权限风险、数据口径、上线检查、客户验收证据。Cloudflare security-audit-skill 的结构化证据格式可借鉴，但场景换成汽车数字化交付。

### 5. 做“低风险 Computer Use”试点

不要先做自动写入 DMS/CRM。先做只读巡检：经销商网页巡检、竞品价格采集、门店素材检查、售后流程截图取证、系统配置差异检查。验证 browser/computer use 的账号隔离、截图证据、失败恢复和人工确认。

## 十、对 OpenClaw 的月度策略建议

### 1. 做 task router + cost ledger 最小闭环

每个任务记录：任务类型、模型、输入 token、输出 token、实际成本、延迟、缓存命中、成功/失败、人工返工、失败原因。先用静态规则，不急着做智能路由。30 天后再用数据调路由。

### 2. 把 artifact registry 做成一等能力

OpenClaw 的输出不应只存在聊天里。日报、周报、月报、审计报告、HTML、PPT、图片、代码 diff 都应进入 artifact registry，带来源、版本、生成任务、复核状态和公开/私有权限。

### 3. 强化权限和执行红线

第三方 repo、setup 脚本、联网、密钥读取、外发消息、删除/配置变更都必须有 policy gate。默认只读，写操作和外发操作需要明确确认。Claude Code 恶意仓库事件证明这不是理论风险。

### 4. 建立 skill 生命周期治理

Skill 要有状态：active、experimental、deprecated、quarantined。每个 skill 需要适用场景、输入输出、质量门、失败样例、版本、最后验证时间。过时 skill 要能降权或隔离。

### 5. Wiki 继续从“存内容”升级为“claim-evidence 系统”

日报/月报不能只堆原文，要沉淀 3-8 条结构性 claim，标注趋势增强、新变量、反转、噪音、来源链接、可信度和复核条件。6 月这套方向已经被反复验证，应继续加固。

## 十一、企业 AI 通用建议

1. **所有 AI 项目先问：输出 artifact 是什么？** 如果没有可审阅交付物，项目容易停在 demo。

2. **所有 Agent 项目先画权限图。** 能读什么、能写什么、谁批准、证据在哪、失败如何回滚、成本归谁。

3. **所有模型选型必须跑自有 eval。** 不用真实业务样本，只看榜单就是盲选。

4. **所有知识库项目必须保留证据链。** 摘要是索引，不是事实本体；原始文档、字段来源和版本必须可追溯。

5. **所有自动化项目先做低风险闭环。** 只读巡检、建议生成、人工确认、结构化回写，跑稳后再开放高风险写操作。

## 十二、下月观察问题

1. Claude Code artifacts、Cursor iOS、OpenTag 这类协作 Agent 是否会形成企业标准工作台？
2. Wayfinder Router / DeepSpec / tokenizer 成本讨论能否在真实企业任务中证明 30% 以上可持续降本？
3. Agent eval 是否会从 awesome list 走向可执行任务包和行业标准？
4. 汽车行业是否会出现成熟的销售/售后/交付 Skill 包？
5. Browser/Computer Use 能否在遗留系统只读巡检里稳定通过权限、安全和证据链要求？
6. X 传闻里的 Grok 4.5、SpaceX/Tesla 闭环是否会被一手发布或第三方评测证实？

## 十三、本月结论

6 月 AI 世界已经给出清晰答案：**企业 AI 的胜负不在“谁先接上最强模型”，而在谁能把模型放进可治理的业务执行系统。**

对 ABU9，最该押的是汽车行业 Skill、artifact 交付、交付审计、真实任务 eval 和低风险 browser/computer use。  
对 OpenClaw，最该押的是 runtime、task router、cost ledger、artifact registry、permission gate、skill 生命周期和 claim-evidence Wiki。  
对企业 AI，最该放弃的是通用聊天壳、单模型崇拜、异常 star 追热点和无人监督全自动叙事。

一句话：**下个月别追“更会聊”，要追“更会交付、更可审计、更能复利”。**
