Skip to content

AI Builders 早报 - 2026-07-20

Published: at 16:00

AI Builders 早报|2026-07-20

今天最重要的事:

Fable 正式发布后,模型层竞争格局出现多个信号:Anthropic 的 Fable 在 cybersecurity 领域极度保守,而 Kimi K3 和 Sol 展示了开放权重模型在特定领域已逼近前沿水平。

为什么重要:

模型层并未 commoditize,但竞争维度正在从单一 benchmark 转向安全性偏好、开放程度、领域专精等多元分化——这对 AI 开发者的模型选型策略有直接影响。

我今天要不要跟进:

如果你在用 Claude Code,今天可以花 15 分钟搭建自己的 “personal eval set”:找 3-5 个与你日常工作相关的任务,在 Fable 和其他模型中对比测试,找到最适合你场景的模型。如果你不做日常开发,建议阅读 Schmidhuber 的访谈——他对当前 CapEx 泡沫的判断值得关注。


事件 1:Anthropic Fable 正式发布,但 cybersecurity 能力引发热议

发生了什么:

Anthropic 于 7 月 18-19 日发布了 Fable 模型。Thariq (Anthropic Claude Code team) 透露这是团队 “literally working around the clock” 的成果,最初不确定能否按时完成。Fable 已集成到 Claude Code 等产品中。

大家在讨论什么:

代表来源:

我的判断:

Fable 的 cybersecurity 保守策略短期看是安全选择,长期可能成为双刃剑——企业客户既需要安全对齐,也需要模型能处理防御性安全任务。这给开放权重模型(Kimi K3、Sol)留下了差异化空间。

建议动作:

如果你在 security 领域做产品,今天就用 Kimi K3 和 Fable 跑一遍你的关键 security 场景,记录差异点。结果可能影响你的模型选型决策。


事件 2:ChatGPT Work 能力展示——从 dictation 到全栈自动化

发生了什么:

OpenAI 的 Thibault Sottiaux (Codex & ChatGPT team) 密集展示了 ChatGPT Work 的实际能力。他演示了通过语音 dictation 让 ChatGPT Work 遍历数千条 Twitter DM,自动分类、评估、整理为结构化 spreadsheet——整个过程只需一段自然语言指令。他形容自己的日常工作已是 “delegating to ChatGPT Work”,ChatGPT Work 现已在 Plus/Pro/Business/Enterprise 计划中可用,支持创建网站、管理邮件、汇总文档、生成办公文档。

大家在讨论什么:

代表来源:

我的判断:

ChatGPT Work 的 dictation + 全栈自动化能力是目前最接近 “AI 替你干活” 的产品体验。对于非技术用户,这可能是他们第一次真正觉得 AI 能直接完成工作。对开发者而言,这意味着需要重新思考哪些产品功能有护城河——如果用户可以直接口述让 AI 生成一个网站,传统 SaaS 的形态需要进化。

建议动作:

今天打开 ChatGPT 试一次 dictation 工作流:口述一个你日常需要 30 分钟以上完成的任务,看 ChatGPT Work 能否直接完成。记录哪些能做、哪些做不好——这本身就是你的 “personal eval set”。


事件 3:Box CEO Aaron Levie 论 AI 生态的多元化扩散

发生了什么:

Box CEO Aaron Levie 发表长文分析 AI 生态格局。他指出,过去几个月已经证明 AI 的价值不会只集中在少数几家巨头手中,而是在多个层面同时展开:垂直领域的模型微调公司、面向企业工作流的应用层 AI 公司、深耕特定领域的新实验室(生命科学、金融、医疗)、新的 agent 基础设施层,以及推动企业变革管理的服务公司。

同时,他认为对中国进行模型封锁不会有效——Kimi K3 的出现证明中国已能在接近前沿水平竞争。解决方案不是收紧管控,而是在保持安全的前提下加快自身创新和生态扩散速度。

大家在讨论什么:

代表来源:

我的判断:

Levie 的分析框架是目前对 AI 生态最务实的描述之一。模型层没有 commoditize,但也没有被少数公司垄断——这意味着创业公司的机会在于垂直深度和 workflow 理解,而非基础模型本身。

建议动作:

如果你在创业或做产品,今天花 30 分钟对照 Levie 的分类框架,定位你的产品在生态中的位置。如果你的价值主张是 “我们用最好的模型”,可能需要重新思考差异化。


事件 4:Schmidhuber 深度访谈——CapEx 泡沫、RSI 护城河、物理 AI

发生了什么:

Unsupervised Learning 播客发布了与 AI 先驱 Jürgen Schmidhuber 的深度对话(Ep 90)。Schmidhuber 对当前 AI 行业的核心判断包括:

代表来源:

我的判断:

Schmidhuber 的观点一贯异端但值得认真对待。他对 CapEx 泡沫的警告在当下有现实意义——如果 compute 成本每五年降 10 倍,今天投入的 infrastructure 确实面临巨大折旧风险。他对 RSI 不是护城河的分析也吻合开源社区的追赶速度。但他的 “physical AGI 还需数十年” 的判断可能低估了仿真环境 + foundation model 对机器人学习的加速作用。

建议动作:

如果你所在的公司正在规划大额 GPU 采购或数据中心投入,建议读完整篇访谈的 CapEx 相关部分。核心问题:如果五年后 compute 成本只有今天的 1/10,今天的投资决策需要重新审视。


事件 5:Zara Zhang 提出 “personal eval set” 理念

发生了什么:

Zara Zhang 建议每个 AI 用户建立自己的 “personal eval set”——找几个与你日常工作/生活真正相关的任务,用不同模型测试,找到最适合你的模型。行业 benchmark 有帮助,但不一定能反映模型对你是否真正有用。

大家在讨论什么:

代表来源:

我的判断:

这是今天最实用的建议。在模型竞争从 “谁分数高” 转向 “谁适合什么场景” 的阶段,personal eval set 是每个 AI 开发者应该拥有的基本工具。

建议动作:

今天创建你的 personal eval set。选 3-5 个你每周都会做的任务(写代码、写文档、数据分析、翻译等),在 2-3 个模型中跑一遍,记录结果。把 eval set 放进你的笔记系统,每次新模型发布时更新测试。


今日可跟进清单

今日可跟进

事件原因
ChatGPT Work dictation 测试今天花 10 分钟口述一个实际任务,验证 ChatGPT Work 的自动化能力
Personal eval set 搭建花 15 分钟创建你的模型评估集,今天 Fable 刚发布正是好时机

后续观察

事件观察点
Fable cybersecurity 策略Anthropic 是否会调整 Fable 的安全拒绝策略粒度
Schmidhuber CapEx 警告后续是否有更多业内人士呼应或反驳他的泡沫判断
Kimi K3 / Sol 开源进展开放权重模型在垂直领域的能力边界是否会继续扩展

可以跳过

事件原因
世界杯相关讨论与 AI Builders 主题无关
旧金山政治话题缺乏 AI 行业相关性
巴黎旅行见闻缺乏信息增量