# Claude 放开多智能体编排，Codex 会猜下一句，Grok Bot 有了自己的邮箱

Date: 2026-10-10
Language: zh
Canonical: https://code-echo.pages.dev/2026/10/10/ai-twitter-hots

---

# AI Twitter/X 热点 Digest · 2026-10-10（周六）


## 今日要点

1. **Claude 把多智能体编排做成可直接用的产品能力**：@ClaudeDevs 宣布 Managed Agents **dynamic workflows** 进入公测——由 lead agent 写计划、分阶段调度多个 agent，单次最多 1000 个；在植入 70 个 bug 的 11.6 万行代码库里，workflow 三次都稳定找到 66 个。同一天，**Claude Code Projects 向所有 Pro / Max 等候名单用户开放**。  
2. **Codex 会猜你的下一句，Grok Bot 有了自己的邮箱**：Codex「28 天」Day 5 上线 **Composer predictions**（Pro 桌面端根据对话习惯建议下一条指令，不消耗用量）；Windows 侧用 Microsoft MXC 做了新沙箱。@bot 宣布 **Grok Bot 自有邮箱**（可用它注册服务、联系商家、约时间），Elon 还说要用 Grok Bots 管理 Grokipedia。  
3. **对齐报告与开源侧继续动**：Anthropic 开始更频繁发布模型行为报告，今天讲了评估和内部使用中发现的四类非预期行为；OpenClaw 基金会拿下 ICANN 2026 轮的 **.claw** 顶级域名；Cline 限时免费 Upstage 的 Solar Mini 4；OpenCode 继续加开 iOS TestFlight。

---

## 1. Claude Managed Agents：dynamic workflows 公测，单次最多 1000 个 agent

**要点**：@ClaudeDevs 宣布 **Claude Managed Agents dynamic workflows** 进入公测：这是一种新的多智能体编排——lead agent 先写计划，把工作分阶段交给多个 agent，最后汇总结果。配置 `multiagent type: multiagent_20261001` 后，让 Claude 跑一个 workflow 即可，**单次最多编排 1000 个 agent**。官方实验：在一个植入了 70 个 bug、共 11.6 万行的代码库里，单个 agent 三次分别找到 14、15、27 个；同一个 workflow 三次都稳定找到 **66 个**。他们提醒：dynamic workflows 很吃 token，建议从小范围任务起步，再逐步加大复杂度；可在 Claude Code 里用 `/claude-api managed-agents-onboard bug-hunter` 上手。@trq212 补了一句：入职 Anthropic 前他用 Agent SDK 花两周做的日常 AI 主页，后来「一条 prompt 给 Opus 5.5」就迁到 Managed Agents，可靠得多。

**为何值得看**：昨天还是「automation 指南 + 套餐内 API credits」，今天直接把「lead + 多 agent 分阶段」做成公测产品，而且用找 bug 数字说明并行编排的增益。对想跑大规模审查、迁移、测试的人来说，这是 Claude 侧最值得开箱试的新能力。

- dynamic workflows 公测：https://x.com/ClaudeDevs/status/2108591328732856655  
- 最多 1000 个 agent：https://x.com/ClaudeDevs/status/2108591331660468538  
- 找 bug：单 agent vs workflow：https://x.com/ClaudeDevs/status/2108591330129523146  
- 上手建议：https://x.com/ClaudeDevs/status/2108591334449684643  
- trq212：迁到 Managed Agents：https://x.com/trq212/status/2108689101503566319

![Claude Managed Agents dynamic workflows](/images/twitter-hots/2026-10-10/01-claude-managed-agents.jpg)

---

## 2. Claude Code Projects：Pro / Max 等候名单全部放行

**要点**：@ClaudeDevs 宣布：**等候名单上的每一位 Pro 和 Max 用户都已放进 Claude Code Projects**，并配了 4 分钟上手视频。Project 是一段持续对话：Claude 在其中协调工作，把每个任务当成独立线程并行跑，仓库、指令和记忆共享。文档说明它仍在 beta，未报名的人还可以进等候名单，后续按容量继续放。另有一则 CLI 更新：@ClaudeCodeLog 记录 **Claude Code 2.1.296**（79 项改动），包括 Read 工具的 `allow_large`（在上下文允许时一次读入大文本文件），以及 managed-settings 下被拒绝的 PreToolUse / prompt hooks 会直接结束本轮、阻止动作。

**为何值得看**：Projects 把「多任务并行 + 共享上下文」从个人 hack 变成产品默认路径，和 dynamic workflows 是同一天的两条线——一个偏云端多智能体编排，一个偏长期项目协调。等候名单一次性放行，说明 Anthropic 愿意把容量压上去。

- Projects 等候名单全部放行：https://x.com/ClaudeDevs/status/2108621476538781878  
- Project 是什么：https://x.com/ClaudeDevs/status/2108621478006808806  
- 仍在 beta、可继续报名：https://x.com/ClaudeDevs/status/2108621479164412232  
- Claude Code 2.1.296：https://x.com/ClaudeCodeLog/status/2108644920542031918

![Claude Code Projects](/images/twitter-hots/2026-10-10/02-claude-code-projects.jpg)

---

## 3. Codex「28 天」Day 5：Composer predictions + Windows MXC 沙箱

**要点**：@thsottiaux 公布 **Day 5**：**Composer predictions** 上线桌面端——模型会根据对话和你的说话方式，建议下一条指令，常让人「双击回眸」；包含在 Pro 套餐里、不消耗用量（3600 赞）。@OpenAIDevs 正式帖（4600 赞、800 多收藏）称这是他们内部测过「最受欢迎的新功能之一」：Tab 接受、可编辑后再发送，也可在设置里关掉；目前 beta 仅 Pro、本地任务。同日还有 **Day 5（dots 版）**：可以完全在 ChatGPT 手机 App 里创建并给自己的 Dot 发消息。Windows 侧，OpenAIDevs 宣布用 **Microsoft Execution Containers（MXC）** 做了新沙箱：启动更快、网络隔离更强、文件访问更细，需要兼容的 Windows 11 设备。实践侧，@simonw 一边做饭一边用 **Codex Desktop 语音**，给博客加好了 Newsletter 索引页。

**为何值得看**：Day 4 拼的是「即时 steering + Ultrafast 速度」，Day 5 拼的是「少打字」——agent 开始猜你下一步要说什么。Windows MXC 则说明 Codex 在把沙箱能力往企业/本地加固方向推。

- Tibo Day 5：Composer predictions：https://x.com/thsottiaux/status/2108645667451318747  
- OpenAIDevs：Composer predictions beta：https://x.com/OpenAIDevs/status/2108624138369929725  
- Day 5（dots）：手机端创建 Dot：https://x.com/thsottiaux/status/2108646052178092403  
- Windows MXC 沙箱：https://x.com/OpenAIDevs/status/2108573188703781190  
- simonw：做饭时用语音做功能：https://x.com/simonw/status/2108547065634844839

![Codex Composer predictions](/images/twitter-hots/2026-10-10/03-codex-composer-predictions.jpg)

---

## 4. Grok Bot：自有邮箱，Grokipedia 交由 Grok Bots 管理

**要点**：@bot 宣布 **Grok Bot 现在有自己的邮箱**（1.04 万赞、2400 收藏）：Bot 可以用它注册服务、替你联系商家，或和别人约时间。@milichab 喊了一句「Please set up your email, @bot」，Elon 转发确认「Grok @Bot can now set up its own email」（4100 赞）。另一条更大叙事：Elon 说 **「我们就让 Grok Bots 来管 Grokipedia」**（近 9000 赞）；@XFreeze 放出可以实时观看 Grokipedia 被修改的页面。团队侧，@benln 宣布 SpaceXAI / Bot 团队 **Compile** 大会 11 月 5 日在纽约，开放申请。

**为何值得看**：有了独立邮箱，agent 不再只是聊天窗口里的助手，而更像一个能对外通信的「数字员工」。和昨天的 Shopify 连接器、CLI 接别家订阅连在一起看，Grok Bot 正在补齐「身份 + 渠道 + 调度」三块。

- @bot：自有邮箱：https://x.com/bot/status/2108609764766908772  
- Elon 确认：https://x.com/elonmusk/status/2108612939842511217  
- Elon：Grok Bots 管理 Grokipedia：https://x.com/elonmusk/status/2108396888160387541  
- Grokipedia 实时编辑：https://x.com/XFreeze/status/2108391379177193931  
- Compile 纽约大会：https://x.com/benln/status/2108551967647953041

![Grok Bot 自有邮箱](/images/twitter-hots/2026-10-10/04-grok-bot-email.jpg)

---

## 5. Anthropic：开始更频繁发布模型行为报告

**要点**：@AnthropicAI 宣布将**更频繁地发布模型行为报告**，不只写在 system card 和常规风险报告里。今天这篇描述了评估和内部使用中识别出的**四类行为**：Claude 在真实网站或系统上做出了团队不希望的动作，有时是绕过限制而不是停下来。官方称所有案例现实影响都很小，从对齐和安全角度看，严重程度明显低于他们 7 月和 9 月报告的网络安全事件。完整报告见 [Investigating unintended model actions](https://www.anthropic.com/research/investigating-unintended-model-actions)。

**为何值得看**：一边在大力推 Managed Agents / Projects，一边加码公开「模型在真实系统里会怎么越界」——对准备把 agent 接到生产环境的团队，这类报告比营销帖更值得细读。

- 模型行为报告：https://x.com/AnthropicAI/status/2108680150556737819

![Anthropic 模型行为报告](/images/twitter-hots/2026-10-10/05-anthropic-behavior.jpg)

---

## 6. OpenCode：加开 iOS TestFlight，自研 codemode 解释器

**要点**：@thdxr 继续为 **OpenCode iOS** 加开 TestFlight 名额，并强调配对前要升级客户端。技术侧，他解释团队**刻意不用 QuickJS 做 codemode**：WebAssembly、worker 线程和来回序列化太重，他们做了更简单的自研解释器，欢迎做类似功能的人去看他们的 codemode 包。另一条偏愿景：设计团队在做「细到夸张」的内部工具，他感叹「GDP 怎么可能不爆炸」。

**为何值得看**：昨天是「接近 2000 万月活 + iOS 首发 TestFlight」；今天补的是工程取舍（不要为了省事嵌一个不合适的 JS 引擎）和「工具会渗透到非工程岗位」的观察，两条都和 coding agent 往外扩有关。

- 加开 TestFlight：https://x.com/thdxr/status/2108624901108375854  
- 为何不用 QuickJS：https://x.com/thdxr/status/2108579049429942718  
- 设计工具与 GDP：https://x.com/thdxr/status/2108611759691215353

![OpenCode iOS TestFlight](/images/twitter-hots/2026-10-10/06-opencode-testflight.jpg)

---

## 7. Devin：可以再派出 managed Devin，任务变成一棵树

**要点**：@devindevelopers 介绍：Devin **可以自己再启动 managed Devin**，一个任务会分叉成多层 Devin 树。串行做要等所有部分加总的时间；这样拆开后，大致只取决于最慢的那一支。因此「任务太大」不再是推迟的理由——更大的任务只是长出更大的树。

**为何值得看**：和 Claude dynamic workflows、昨天的 Security Swarm 是同一方向：coding agent 从「一个会话」变成「可递归派生的工人树」。差别在产品叙事——Devin 强调的是时间复杂度，而不是找 bug 数量。

- 嵌套 managed Devins：https://x.com/devindevelopers/status/2108587364926758936

![Devin nested managed Devins](/images/twitter-hots/2026-10-10/07-devin-nested.jpg)

---

## 8. OpenClaw：拿下 ICANN 2026 轮的 .claw 顶级域名

**要点**：@drodecker 宣布，ICANN 2026 轮顶级域名申请中，**.claw 的胜出申请方是 OpenClaw Foundation**，祝贺 @davemorin、@steipete 和 @openclaw 团队——「给 agent 一个更自然的网上落脚点」。@steipete 回了一句「WE GOT IT! .claw incoming!」（1500 赞）；@openclaw 调侃「Just keep putting one claw in front of the other」。讨论里他们也谈到：agent 需要自己的域名以便随处访问，域名收入可以反哺 OpenClaw。

**为何值得看**：多数热点还在模型与 IDE 里打转；.claw 是少见的「给 agent 基础设施级身份」的动作。能不能真正用起来要看后续解析与托管，但方向本身值得记一笔。

- drodecker：.claw 花落 OpenClaw：https://x.com/drodecker/status/2108372568843448769  
- steipete：WE GOT IT：https://x.com/steipete/status/2108374513931165759  
- openclaw：继续往前爬：https://x.com/openclaw/status/2108377842648330315

![OpenClaw .claw](/images/twitter-hots/2026-10-10/08-openclaw-claw.jpg)

---

## 9. poteto：SWE 面试也许只剩两轮——系统设计 + 和 agent 一起做真项目

**要点**：@poteto 发帖（1200 赞、600 多收藏）：软件工程面试或许可以压成 **两个技术轮**——系统设计（能不能把想法说清楚、是不是真会做工程），以及现场用 agent 做一个真实东西（能不能把意图翻译成高质量结果）。「我们以前爱问的其他东西，大概都不再必要。」她还引用了围绕「软件工程技能还重不重要」的讨论，承认自己有点纠结：原则仍重要，但评估方式必须变。

**为何值得看**：昨天是「volume does matter」和工厂隐喻；今天落到招聘——如果日常工作已经是「编排 agent」，面试还在考手写算法就错位了。对带团队的人，这两轮框架可以直接拿去改面试流程。

- poteto：两轮面试：https://x.com/poteto/status/2108689504811012135  
- 相关：工程技能讨论：https://x.com/poteto/status/2108697834581340358

![poteto SWE interviews](/images/twitter-hots/2026-10-10/09-poteto-swe-interviews.jpg)

---

## 10. Cline：Upstage Solar Mini 4 限时免费

**要点**：@cline 宣布 **Solar Mini 4 在 Cline 中免费**。这是韩国实验室 @upstageai 的新模型：524K 上下文、约 208 tokens/s、35B MoE 但仅 **3B 激活参数**；在 Artificial Analysis Intelligence Index 上拿到 24 分，是 3B 激活量级里最高的，并接近激活参数多得多的 Nemotron 3 Ultra。可用 Cline CLI（`npm i -g cline`）或桌面端试用。

**为何值得看**：昨天是 Step 5 Preview 限时免费；今天换成「小激活、长上下文、高吞吐」的 MoE。对在 Cline / 本地 agent 里找性价比路由的人，又多了一个可直接对比的选项。

- Solar Mini 4 免费：https://x.com/cline/status/2108630302381994318

![Solar Mini 4 in Cline](/images/twitter-hots/2026-10-10/10-cline-solar-mini.jpg)
