Grok 4.7 已可在 Amazon Bedrock 上使用
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
Hcompany 发布智能体模型 Holo4,提供 27B 稠密版与 35B-A3B MoE,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖图形界面、代码和工具调用,便于对照它在更低成本下与闭源模型的长流程得分差距。
GitHub Copilot app 可用 /create-canvas 把自然语言描述变成在右侧面板打开、与智能体共享的 canvas。提示要写清工作流、使用者能直接操作的内容,以及智能体能添加或更新的事项,界面可以是看板、议题分拣板、发布清单、仪表盘、表单或表格。
与大语言模型交互三年后,主要界面仍是聊天,但 GitHub Copilot 应用中的 canvas 可按具体任务生成没有浏览器外壳的全栈界面,使操作常常不必停留在对话框。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
Antonio Morales 基于 GitHub Security Lab Taskflow Agent 构建了 Fuzzing Taskflow,给出 GitHub 仓库后即可为 C/C++ 项目自动识别入口、编写 harness、运行 AFL++、改进覆盖率,并为每个独立缺陷撰写漏洞报告。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。
Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。
推荐理由:原文对比 Opus 5 给出 token 效率与定价变化,并附 Bedrock 调用方式,便于判断迁移成本与接入路径。
NVIDIA Isaac ROS 5.0在多伦多ROSCon发布,引入智能体工作流与GPU加速软件包,帮助人与AI智能体共同开发机器人。FoundationPose提供面向智能体的推理库,使机器人感知并跟踪物体位姿的速度最高可快5.5倍。新版支持ROS Lyrical和Ubuntu 24.04。
GitHub Copilot运行时从TypeScript重写为Rust,由AI代理主导完成,超过80万行Rust代码。迁移过程实现了性能提升和跨产品共享运行时。
推荐理由:原文详细记录了使用Copilot代理将GitHub Copilot运行时从TypeScript迁移至Rust的过程,性能提升显著,并实现了多产品共享。
GPT-6 Astra 帮助 Hex 的数据代理将分析答案转化为可交互可视化报告,使员工愿意分享这些可视化内容。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,专注于近实时推理和语音代理。
推荐理由:Google DeepMind 发布了 Gemini 3.8 Live 系列模型,提升实时推理和语音代理能力,支持复杂任务执行与流畅对话,为开发者构建生产级语音代理提供高效工具。
GitHub Copilot App 内置 diff、terminal 和 browser 面板,让用户在同一界面内审查 AI 代码更改、运行命令并预览功能,无需切换编辑器、终端和浏览器。
ChatGPT Work 推出 Data agent,用户可用自然语言连接公司数据、发现洞察,并构建 AI 驱动的交互式仪表盘。
GitHub Copilot app 支持同时运行多个智能体,每个会话相互独立,并可各自基于独立的 Git worktree 并行执行、保留自身上下文。用户在 sessions view 中可通过卡片查看各会话标题与任务进度,自由切换且无需重新说明上下文。以 tailspin-toys
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最高降低 88%、成本最高降低 66%、准确率最高提升 7%。
推荐理由:原文给出了 token 与成本降幅的具体数字和 API 启用方式,读者可据此判断长视频分析的成本边界。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Google DeepMind 在 DOE 的 Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI token 与云额度,支持 Genesis Mission 的科研人员。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
Mistral 为 Connectors 新增多项管理与安全能力:按 workspace 或组织分配连接器访问权限、带 connector scope 的 API key、单个连接器绑定多账号,三项均已 GA。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的 12B 多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干,16GB 显存或统一内存即可本地运行。
推荐理由:无编码器架构把视觉与音频直接接入 LLM 主干,读者可了解端侧多模态模型在显存与延迟上的取舍。
Google 推出由 Gemini Enterprise Agent Platform 托管的 Cross-Corpus Retrieval,基于 Agentic RAG 驱动,可处理多源、多跳的复杂查询。
Mistral 将 Le Chat 升级为统一的 AI 智能体 Vibe,同一订阅同时覆盖工作与编码,用户原有的对话、设置和方案自动保留。
推荐理由:Le Chat 升级为 Vibe 后把工作流与编码并入同一智能体和同一订阅,读者可了解其功能边界与定价分层。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助各行业大规模采用前沿 AI。
Google Research 推出 PaperVizAgent 与 ScholarPeer 两款学术智能体,分别用于生成论文配图和自动同行评审。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Mistral AI 发布 Devstral 2 编码模型系列,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,并推出配套开源 CLI Mistral Vibe。
推荐理由:官方给出参数规模、基准得分与人类评估胜率,可对照开源与闭源编码模型的能力与成本差距。
Mistral AI 发布企业级生产 AI 平台 Mistral AI Studio,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。