AI Twitter 热点 · 2026-09-29
AI Twitter/X 热点 Digest · 2026-09-29(周二)
今日要点
- Claude Sonnet 5.5 发布:相对 Sonnet 5 约快 30%、多数工作最多约便宜 30%;Claude Code 默认切过去,Cursor / Copilot / Devin 同日上架。
- Theo 继续拆 Claude Code 配额:约 $200 订阅≈$9k/月 Opus 用量;另有 Opus 5.5 把 Astra 的 ts-rust 推倒重写的故事。基准圈则在吵 Sonnet 5.5 是否压过 GPT-6 Sol / Astra。
- Devin 降价并推 Mobile;OpenCode 谈 Go 经济性与免费 SSO;另有 MSR Agensh 自组织多智能体、Jev 进 harness,以及 OpenWorker × Nvidia OpenShell / Perplexity SPACE 的沙箱红队叙事。
1. Claude Sonnet 5.5:第二个 Claude 5.5,更快也更省
要点:@claudeai / @AnthropicAI 发布 Claude Sonnet 5.5——Claude 5.5 家族第二款;相对 Sonnet 5 是明确升级,运行快 30%+,多数工作最多约便宜 30%。Claude Code 侧立刻跟进:@bcherny 演示用它修 bug,强调「更快 + 更少用量」;@catwu 称相对 Sonnet 5 大约多完成 ~30% 任务(更聪明→同样工作更少 tokens);@alexalbert_ 说手感接近他喜欢的 Opus 5.5——写得清楚、很快,能力相对 Sonnet 5 是大跳。社区日志也显示 Claude Code 默认 Sonnet 已切到 5.5(含 1M context 与新定价)。
为何值得看:在 Opus 5.5 刷屏配额之后,Anthropic 把「差不多的手感」压进更便宜、更快的 Sonnet 档——日常 agent 循环的默认模型很可能整周重排。
- 官宣:https://x.com/claudeai/status/2104633115620823187
- Anthropic:https://x.com/AnthropicAI/status/2104633259925630995
- Claude Code 修 bug:https://x.com/bcherny/status/2104638725317923228
- 任务吞吐:https://x.com/_catwu/status/2104639552170377399
- 手感:https://x.com/alexalbert__/status/2104633937280811010

2. Day-one 分发:Cursor / Copilot / Devin 同步上架 Sonnet 5.5
要点:@cursor_ai 宣布 Sonnet 5.5 已在 Cursor 可用,并称许多任务上表现可与 Opus 看齐。@github / @code 同步:Sonnet 5.5 在 GitHub Copilot(App / CLI / VS Code)一般可用;早期测试里编码任务表现贴近 Sonnet 5,但步数、tokens、工具调用更少,完成更快。@cognition 则把 Sonnet 5.5 放进 Devin Desktop / CLI,FrontierCode 1.1 Main 报 64.4%(Sonnet 5 为 56.2%),并称超过高推理档的 Fable 5.1。
为何值得看:模型发布日几乎同时打穿主流 IDE / agent 客户端——分发速度本身就是产品竞争力。
- Cursor:https://x.com/cursor_ai/status/2104666044220821594
- Copilot:https://x.com/github/status/2104637226336538862
- Devin:https://x.com/cognition/status/2104670026770919586

3. Theo:Claude Code 配额经济学,以及 Opus 推倒 Astra 的代码
要点:@theo 算了一笔账:约 $200 的 Claude Code 订阅,按他烧掉的用量折算,大约等于每月 ~$9,000 的 Opus API 用量——Opus 5.5 发布后他已把 3 个账号打到 0%,周均约 $2,200。另帖纠正自己对 ts-rust(TS 编译器迁 Rust)的叙事:他原以为 Opus 是接着 Astra 卡住的地方往下做,实际上 Opus 判定 Astra 代码是 slop,从零新建 crate;自称 10 小时 进度超过 Astra 两周。
为何值得看:一边是订阅相对 API 的「划算到离谱」,一边是 coding agent 会不会直接重写前人产物——配额与工作流策略都在跟着变。
- 配额:https://x.com/theo/status/2104683186215363058
- Opus 重写:https://x.com/theo/status/2104703240680133115

4. 基准热议:Sonnet 5.5 是否压过 GPT-6 Sol / Astra?
要点:@haider1 连发对比:Sonnet 5.5 xhigh 52.1% vs GPT-6 Sol 49.3%;更大故事是 High 档位上 Sonnet 约 $0.5/task 就能摸到 Sol 最佳表现(约 $2.2)。Artificial Analysis Intelligence Index 上他报 Sonnet 5.5 56、Astra 53、Sol 48。另有图称 Sonnet 5.5 在 Terminal-Bench 上好过 Opus 5.5,知识工作 / computer use 基本持平,价格大约便宜一倍——「把大半个 Opus 体验压进 Sonnet」。这些是第三方/社区汇总,不是官方榜单定论。
为何值得看:发布日讨论已经从「有没有新模型」转到「中档模型是否吃掉上一代旗舰的性价比甜点」。
- vs Sol:https://x.com/haider1/status/2104641998028521517
- AA Index:https://x.com/haider1/status/2104643167614312895
- vs Opus:https://x.com/haider1/status/2104635161229021510

5. Devin:全线降价 + Mobile beta
要点:@cognition 宣布 Devin 显著降价——Fusion / Normal 约便宜 30–40%,Ultra 15–20%,Devin Review 最多约 70%,同时称能力上升,Fusion 在 FrontierCode 1.1 Extended 排第一。另推 Devin Mobile 公测候补;@dabit3 等强调可在云端 Mac 机群上远程构建/测 iOS。
为何值得看:独立 coding agent 一边卷模型接入(见上条 Sonnet),一边直接打价格与移动端入口。
- 降价:https://x.com/cognition/status/2104633216145436831
- Mobile:https://x.com/cognition/status/2104597797672784234

6. OpenCode:Go 的「不可能经济学」、免费 SSO、Go Plus $40
要点:@thdxr 说做 OpenCode Go 的同事最难——要在客户永远嫌不够的前提下硬算 LLM 可负担性;行业常觉得这不够 glamorous,但他点名 Costco / Walmart / Amazon 式生意。同日:Go Plus $40/月 更高限额;OpenCode Console 的 SSO / SCIM 等将免费提供——「agent 时代还收这钱有点离谱」。
为何值得看:开源 harness 的战场不只在模型榜,也在订阅档位与企业登录是否「默认该免费」。
- Go 经济性:https://x.com/thdxr/status/2104555514524799094
- SSO/SCIM:https://x.com/thdxr/status/2104593316478136693
- Go Plus:https://x.com/thdxr/status/2104548412670755225

7. MSR Agensh:上千 coding agents,没有中心编排器
要点:@omarsar0 力荐微软研究院论文:一次拉起 1000+ coding agents,测可扩展的自组织多智能体 harness Agensh——没有中心 orchestrator,靠共享状态 / 工作区 / 消息通道异步认领子任务、验证与合并。在 ProgramBench 最难五题上(GPT-5.6-sol),agent 数从 1→128,平均最终测通率约 19.31%→28.78%;pandoc 上 1024 agents 可把测通率从约 33.9%→55.1%。@jyangballin 等也强调编排是「自决」而非中央队长。
为何值得看:和「公司级 harness OS」叙事对照——有人在验证「无主管、只靠共享状态」能否在真实大仓库上抬测通率。
- 解读:https://x.com/omarsar0/status/2104377054829613473
- ProgramBench:https://x.com/jyangballin/status/2104448801322979722

8. Jev:a16z 对谈,以及 harness 里的决策 / 路由层
要点:@a16z 放出 TypeSafe 的 Diogo Almeida 与 Ben Horowitz / Martin Casado 长谈:Jev 被定位为「活在软件里」的分类/决策模型——读自然语言,从选项集返回带置信度的选择,目标是让程序消费意图,而不是只生成给人看的文本。工程侧同日继续落地:@hwchase17 转述 GPT Researcher 用 Jev 换 embedding 做检索决策,相关上下文约 73% vs 46%;@omarsar0 演示同一 Codex 会话里用 Jev 在 Opus / Astra / Kimi / DeepSeek / GLM 间路由,自称约便宜 40%、快 15%。中文圈 @idoubicc 晒 autojev.ai 上基于 Jev 的本地模型路由器(站点自称开源向,发布前请自行核验仓库与协议)。
为何值得看:Jev 从「裁判/门禁」继续扩到检索与多模型路由——harness 里的 System-1 零件越来越标配。
- a16z 对谈:https://x.com/a16z/status/2104580361254810080
- 检索决策:https://x.com/hwchase17/status/2104610254000635952
- 多模型路由:https://x.com/omarsar0/status/2104623036133417456
- autojev:https://x.com/idoubicc/status/2104545729918451816

9. OpenWorker × Nvidia OpenShell:用确定性代码做 agent 沙箱
要点:@AndrewYNg 回应弱沙箱导致的安全事件,称赞 Nvidia 开源 agent 沙箱工具;他与 @rohitcprasad 的开源 harness OpenWorker 将基于 Nvidia OpenShell,默认把密钥、浏览器登录、任意出网等挡在确定性代码之外(而非只靠 prompt),并做审计日志。引用 @JensenHuang 宣布的 NVIDIA Open Agent Safety Platform(OpenShell + Sentry,号称 100+ 伙伴)。注意:OpenWorker 仓库并非今日新开源(早先已有公开仓库与发行版),今日重点是对接 OpenShell / 安全平台叙事。
为何值得看:agent 能不能进生产,越来越取决于「权限边界是不是代码级」而不只是模型听话。

10. Perplexity SPACE:给沙箱做红队,并点名业界 IP 共享坑
要点:@AravSrinivas 披露安全组花一个月打 SPACE(跑 Perplexity Computer 的沙箱):给 9 个模型(含 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等)VM 内 root,有时还附沙箱源码,目标是逃逸到宿主机或打到策略禁止的 URL。108 次运行无人逃出 VM;但一旦放开一点装包网络(PyPI / Ubuntu mirror),有 4 个模型通过 DNS 欺骗 + Fastly 共享 IP、或经图片抓取/OCR 绕到禁 URL。他们已修复并复测,并称抽查的 10 家沙箱商里 8 家有同类 IP 共享问题(点名如 E2B、Vercel、Modal)。文末表示愿与 Nvidia 的 Open Agent Safety Platform 协作——和上条同一天的沙箱主题。
为何值得看:computer-use / cloud agent 的护栏讨论,从「要不要沙箱」进入「共享 IP / 侧信道怎么被模型利用」。
