Grok 4.7 已可在 Amazon Bedrock 上使用
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
Anthropic 发布 Claude Sonnet 5.5,称其运行速度快 30% 以上、多数任务成本最多降低 30%,定价与 Sonnet 5 相同。该模型现用于 claude.ai 免费层,Simon Willison 实测它在部分编码任务上接近 Opus 5.5。Anthropic 同时表示 Haiku 5.5 将在未来几周内推出。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5,输出快逾 30%,单任务成本最多低 30%。
推荐理由:Sonnet 5.5多项基准接近Opus 5.5且单任务成本最多低三成,编码成绩相对前代抬升尤其明显。
Anthropic 发布中端模型 Sonnet 5.5,称其比约三个月前的 Sonnet 5 快 30%、费用低得多,token 消耗速率明显更慢,可用于编程和制作办公文档等日常任务。
Meta 推出新业务单元 Meta Enterprise Platform,向企业出售 AI 工具。首批包括 Muse agent、Meta Business Agent、Muse API 和 Muse Code,由前 MongoDB CEO Chirantan Desai 负责并直接向 Mark Zuckerberg 汇报。
Atlassian 联合创始人兼 CEO Mike Cannon-Brookes 在 The Verge 的 Decoder 访谈中反驳 SaaSpocalypse,认为前沿模型即使再增强,也难以独自运营充满合规、人员与创造性的复杂企业。
OpenAI 正在征集用 Codex 做出出色成果的建造者、动手实践者、研究者和创作者的真实故事。想加入 Codex Originals 项目下一章的人,可在下方介绍自己的故事和项目。
Simon Willison 用闭幕演讲笔记按时间串起 2026 年迄今的 LLM 变化,指出 Claude Opus 4.5 和 GPT-5.1 配上各自编码智能体后已足以日常使用。
Simon Willison 让 Opus 5.5 vibe code 了一款 Bluesky 回复机器人检测工具。信号包括同一账号数秒内连续回复、从不发布原创内容(或图片、链接)却持续回复粉丝更多的用户,以及问号。不同于 Twitter,Bluesky 仍有免费且实用的 API,便于调查这些机器人。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,把销售额提升了 60%,并节省 75+ 小时。依托这套模型组合,该公司得以更快地构建、运营和销售现代车队管理服务。
与大语言模型交互三年后,主要界面仍是聊天,但 GitHub Copilot 应用中的 canvas 可按具体任务生成没有浏览器外壳的全栈界面,使操作常常不必停留在对话框。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agents 构建者的 Agentic Engineering 同好交流会(Birds of a Feather)。
GitHub Copilot App 内置 diff、terminal 和 browser 面板,让用户在同一界面内审查 AI 代码更改、运行命令并预览功能,无需切换编辑器、终端和浏览器。
GitHub Copilot app 支持同时运行多个智能体,每个会话相互独立,并可各自基于独立的 Git worktree 并行执行、保留自身上下文。用户在 sessions view 中可通过卡片查看各会话标题与任务进度,自由切换且无需重新说明上下文。以 tailspin-toys
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
Mistral 为 Connectors 新增多项管理与安全能力:按 workspace 或组织分配连接器访问权限、带 connector scope 的 API key、单个连接器绑定多账号,三项均已 GA。
Mistral 将 Le Chat 升级为统一的 AI 智能体 Vibe,同一订阅同时覆盖工作与编码,用户原有的对话、设置和方案自动保留。
推荐理由:Le Chat 升级为 Vibe 后把工作流与编码并入同一智能体和同一订阅,读者可了解其功能边界与定价分层。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Mistral AI 发布 Devstral 2 编码模型系列,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,并推出配套开源 CLI Mistral Vibe。
推荐理由:官方给出参数规模、基准得分与人类评估胜率,可对照开源与闭源编码模型的能力与成本差距。
Mistral 发布企业级 AI 编程助手 Mistral Code,基于开源项目 Continue 构建,今日开放支持 JetBrains IDE 和 VSCode 的私有 beta,正式版即将推出。