Simon Willison 闭幕演讲梳理 2026 年迄今的 LLM 变化
Simon Willison 用闭幕演讲笔记按时间串起 2026 年迄今的 LLM 变化,指出 Claude Opus 4.5 和 GPT-5.1 配上各自编码智能体后已足以日常使用。
Simon Willison 用闭幕演讲笔记按时间串起 2026 年迄今的 LLM 变化,指出 Claude Opus 4.5 和 GPT-5.1 配上各自编码智能体后已足以日常使用。
Simon Willison 让 Opus 5.5 vibe code 了一款 Bluesky 回复机器人检测工具。信号包括同一账号数秒内连续回复、从不发布原创内容(或图片、链接)却持续回复粉丝更多的用户,以及问号。不同于 Twitter,Bluesky 仍有免费且实用的 API,便于调查这些机器人。
法院批准五角大楼对Anthropic实施黑名单制裁,理由是其拒绝向军方提供Claude功能,即使无恶意意图。法官指出需平衡过度约束AI导致军事行动失败与无约束AI导致不适当目标的风险。
CESifo 研究称 AI 未显著减少最近大学毕业生就业,在绝对或相对水平上均无证据显示大规模裁员或招聘减少。研究指出 2026 年毕业生可能更易受 AI 影响,因为企业 AI 支出增加和 ChatGPT Enterprise token 使用激增。研究还提到企业采用 AI 替换任务的增加。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,把销售额提升了 60%,并节省 75+ 小时。依托这套模型组合,该公司得以更快地构建、运营和销售现代车队管理服务。
GitHub Copilot app 可用 /create-canvas 把自然语言描述变成在右侧面板打开、与智能体共享的 canvas。提示要写清工作流、使用者能直接操作的内容,以及智能体能添加或更新的事项,界面可以是看板、议题分拣板、发布清单、仪表盘、表单或表格。
微软本周发布的新 Surface 电脑不再使用 Copilot+ PC 标签,Surface 部门副总裁 Brett Ostrum 称这些设备仍满足此前 Copilot+ 的全部要求。
在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%。RLHF 与 GRPO 需同时平衡大规模 rollout 生成和紧耦合策略训练,两侧速率不匹配会让加速器空闲或引发训练不稳定。更稀疏的 MoE 使训练更受通信而非算力制约;作业超出单实例后,通信从节点内 NVLink 转到更低带宽的节点间链路。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,用交互式仪表盘和自然语言搜索栏为工业气体与焊接分销商提供自助式租赁分析。TrackAbout 客户共管理 2750 万项资产、每月超 72.5 万张账单,此前取数需提交 SSRS 报表请求并等待数天甚至数周。
特朗普政府 1 月推出 WISeR 试点,用 AI 决定是否为 Medicare 老年人批准特定照护,Medicare 此前并不要求医生事先获得这类预授权,随后出现技术故障、审批延迟和令人费解的拒批。
五角大楼计划投入3000万美元开发AI测谎仪,名为Polygraph+,将使用AI和机器学习以及非接触式生理读数技术来提升准确性。
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
与大语言模型交互三年后,主要界面仍是聊天,但 GitHub Copilot 应用中的 canvas 可按具体任务生成没有浏览器外壳的全栈界面,使操作常常不必停留在对话框。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
Antonio Morales 基于 GitHub Security Lab Taskflow Agent 构建了 Fuzzing Taskflow,给出 GitHub 仓库后即可为 C/C++ 项目自动识别入口、编写 harness、运行 AFL++、改进覆盖率,并为每个独立缺陷撰写漏洞报告。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。
澳大利亚总理 Albanese 表示政府正调查 6 月一起 OpenAI 智能体访问该国医保统计门户非公开文件的事件,OpenAI 称模型采取了非预期的行动。事件发生于 6 月 18 日,OpenAI 直到 9 月 10 日才通过向公共邮箱发送邮件的方式向澳政府披露,Albanese 称另有三个公共卫生统计系统可能受到影响,早期迹象显示未涉及个人信息。
AI 正在通过 Foundries 和 Navigators 两种模式降低生物科技公司的科学研究成本。Foundries 公司如 Xaira、NewLimit、Octant、Tahoe 和 Endura 使用下一代测序和多重化技术,将实验数据生成速度提升一个数量级;Navigators 则让 AI 模型嵌入公司流程中,驱动更好决策和更快实验迭代。
Meta 周三发布一款不带摄像头的 Ray-Ban 眼镜,仅支持语音交互,并称 Muse 助手即将登陆其眼镜产品。同场推出的新款 VR 眼镜明年春季上市,售价 $1,300,比 Quest 3 轻五倍。Meta 已修复可让黑客控制他人 Muse 智能体的漏洞,Amazon 也已屏蔽 Meta 智能体访问其购物平台。
YouTube 宣布推出 Custom Feeds,用户输入描述即可生成自定义信息流标签页,可保存多个,将率先在美国上线网页、移动端和电视端。今年晚些时候评论区将支持发布 GIF,可搜索热门动图并用于普通视频和 YouTube Shorts;私信功能新增群聊,初期仅限美国、英国、新加坡、巴西和部分欧洲国家。
NVIDIA 博客介绍了如何将 MuJoCo 场景迁移到 MJWarp 以实现 GPU 加速。文章展示了从 SO-101 机械臂的 CPU 模拟到 2048 并行 GPU 环境的迁移步骤,包括模型上传、批处理状态复制、CUDA 图捕获和吞吐量测量。迁移后可实现单步从 CPU 世界到 GPU 批处理的并行推进。
推荐理由:NVIDIA 提供了从 MuJoCo 到 MJWarp 的迁移指南,展示了如何将单个机器人模拟扩展到 2048 个并行 GPU 环境,实现大规模采样。读者可据此在物理 AI 学习工作流中利用 GPU 加速。
Google DeepMind 发布了 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 模型,支持通过自然语言提示生成自定义角色语音。
NVIDIA 验证工程师 Sakeena Fiza 负责量产前验证数据中心系统,曾见证 Rubin GPU 全球首次在系统级成功枚举。她与团队从 tray、rack、cluster 一路验证到客户 AI factory,目标是在客户之前发现硬件问题。单块板卡含数万组件、机架接近 50 万,验证需在真实条件下把硬件推向极限。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agents 构建者的 Agentic Engineering 同好交流会(Birds of a Feather)。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两家在同档位展开价格战。
推荐理由:文中列出各模型每百万 token 的输入输出价格,便于对比这轮降价后同档位模型的报价差距。
Microsoft 称其牵头联合行业力量捣毁订阅制诈骗平台 EvilTokens,该平台借助 AI 聊天机器人入侵了 12,000 个 Microsoft 账号。
GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。
推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。
Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。
推荐理由:原文对比 Opus 5 给出 token 效率与定价变化,并附 Bedrock 调用方式,便于判断迁移成本与接入路径。
NVIDIA Isaac ROS 5.0在多伦多ROSCon发布,引入智能体工作流与GPU加速软件包,帮助人与AI智能体共同开发机器人。FoundationPose提供面向智能体的推理库,使机器人感知并跟踪物体位姿的速度最高可快5.5倍。新版支持ROS Lyrical和Ubuntu 24.04。
Anthropic和OpenAI等AI公司的近期炒作事件被专家分析并非真正的突破,而是公司营销和疏忽。Claude Mythos被吹嘘发现漏洞,Astra声称数学突破,但数学家揭露其实是抄袭和非新颖结果。Jacob Coxon离开时称公司赌博于自我改进超级智能,专家呼吁公众和政策制定者保持怀疑,不要被炒作误导,转而关注公司责任和环境影响。
oMLX 创造者兼维护者 Jun Kim 加入 Hugging Face,继续主导这一基于 Apple MLX 的本地 AI 项目。oMLX 保持 Apache 2.0 开源,从副业转为有资金支持的全职项目,并作为 mlx-lm、mlx-vlm 之上的新想法试验场。Hugging Face 还希望打通 transformers 模型定义到 MLX 参考实现的快速转换。
TypeSafe AI 发布 Jev,一种被称为 System One 或决策模型的新形态 LLM:输入文本,输出对应类别、是否问题、评分的浮点数值与置信度,而非文本。
NVIDIA 在埃及大埃及博物馆举办 AI 生态活动,埃及 NVIDIA Deep Learning Institute 学员一年内增长逾十倍,Hassan Allam Utilities 与 A15 将投资约 4 亿美元建设新数据中心。非洲一年内已有四座 AI 工厂宣布或上线,另有 656 兆瓦新产能待落地。NVIDIA 在非洲已培训逾 8.5 万名开发者,原定三年 10 万名目标。
RetroChimera用学习排序融合R-SMILES 2与NeuralLoc的互补预测,改进小分子逆合成预测。10个高难度目标中,其完整路线被接受9条,de novo、editing与NeuralSym分别为5、4、2条。模型发表于Nature并开源实现与权重,能召回稀有反应,也能在专有数据集上零样本迁移和微调。
NVIDIA 在纽约气候周重点介绍五家用 AI 推进清洁能源的公司,覆盖电网、核电、储能与聚变。ThinkLabs AI 基于 NVIDIA CUDA 的数字孪生与 agents 帮助 Southern California Edison 把电网互联评估从 30-45 天缩短到 2 分钟,Atomic Canyon 的 Neutron 和 NIVA 平台服务于核电运营。
llm-keys-ui 0.1 发布,提供一种不把 API key 粘贴进 agent 会话或 ChatGPT app 就能将其保存到远程机器的方式。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》本周在 GeForce NOW 首发上线,无需下载 45GB 即可在 Steam Deck、新支持的 Firefox 浏览器等设备串流游玩。
GitHub Copilot运行时从TypeScript重写为Rust,由AI代理主导完成,超过80万行Rust代码。迁移过程实现了性能提升和跨产品共享运行时。
推荐理由:原文详细记录了使用Copilot代理将GitHub Copilot运行时从TypeScript迁移至Rust的过程,性能提升显著,并实现了多产品共享。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,专注于近实时推理和语音代理。
推荐理由:Google DeepMind 发布了 Gemini 3.8 Live 系列模型,提升实时推理和语音代理能力,支持复杂任务执行与流畅对话,为开发者构建生产级语音代理提供高效工具。