llm-keys-ui 0.1 发布:无需粘贴即可为远程机器配置 API key
llm-keys-ui 0.1 发布,提供一种不把 API key 粘贴进 agent 会话或 ChatGPT app 就能将其保存到远程机器的方式。
llm-keys-ui 0.1 发布,提供一种不把 API key 粘贴进 agent 会话或 ChatGPT app 就能将其保存到远程机器的方式。
OpenAI 发布澳大利亚青少年安全蓝图,这是一项包含六大支柱的路线图,旨在为年轻人提供更安全的 AI 体验并赋能青少年。
Pawprint Studio 的开放世界捉宠 RPG《Aniimo》本周在 GeForce NOW 首发上线,无需下载 45GB 即可在 Steam Deck、新支持的 Firefox 浏览器等设备串流游玩。
GitHub Copilot运行时从TypeScript重写为Rust,由AI代理主导完成,超过80万行Rust代码。迁移过程实现了性能提升和跨产品共享运行时。
推荐理由:原文详细记录了使用Copilot代理将GitHub Copilot运行时从TypeScript迁移至Rust的过程,性能提升显著,并实现了多产品共享。
OpenAI 与 AARP 将在美国 10 个城市为 1,000 名老年人举办免费 ChatGPT 实操工作坊,帮助他们安全地掌握实用 AI 技能。
ChatGPT Work 与 Codex 分析帮助团队理解 AI 使用量和支出,识别培训需求,并将采用情况与业务结果关联。
GPT-6 Astra 帮助 Hex 的数据代理将分析答案转化为可交互可视化报告,使员工愿意分享这些可视化内容。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,专注于近实时推理和语音代理。
推荐理由:Google DeepMind 发布了 Gemini 3.8 Live 系列模型,提升实时推理和语音代理能力,支持复杂任务执行与流畅对话,为开发者构建生产级语音代理提供高效工具。
NVIDIA 公布 DSX 平台早期验证结果:Lambda 在 19 节点 HGX B200 集群上运行 DSX MaxLPS,同等功耗预算下 token 吞吐提升 24%,每瓦性能提升 23%。
GitHub Copilot App 内置 diff、terminal 和 browser 面板,让用户在同一界面内审查 AI 代码更改、运行命令并预览功能,无需切换编辑器、终端和浏览器。
ChatGPT Work 推出 Data agent,用户可用自然语言连接公司数据、发现洞察,并构建 AI 驱动的交互式仪表盘。
Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持在私有云、公有云、本地及完全气隙环境部署推理并保持控制。企业还可在受控环境用专有数据训练自有模型并保留数据与智能所有权,面向主权 AI 需求。Mistral 提到 Cloudera 平台承载 30 exabytes 客户管理数据。
Paul Christiano 加入 OpenAI 基金会董事会及其安全委员会,带来 AI 对齐、安全与标准领域的专业经验。
Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测。该平台包含数千个分子效应预测,覆盖多个细胞类型,已在罕见病研究中验证变异功能。AlphaGenome Atlas 通过网站、AlphaGenome API 和 Google Antigravity 提供。
推荐理由:Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测,并推出 AVI 分数用于变异影响评估。
OpenAI 讨论能力更强、价格更可负担的 AI 如何扩展个人与企业可完成的工作,并让增长变得更经济。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的规模最大的股权融资,资金将用于扩展前沿研究、算力容量、基础设施以及商业化与国际业务。公司目前在 20 个国家运营,服务 125+ 家全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:融资规模与投资方结构显示欧洲主权 AI 路线的资本支持力度,可用于对照 Mistral 全栈开源布局的商业方向。
ChatGPT Images 2.5 发布,帮助用户将想法、草图和参考照片转化为更个性化、更精致的图像,生成的图像更能反映用户的原始想法。
OpenAI 联合 AIRPPU 与 WAN-IFRA 推出 AI 项目,支持乌克兰新闻机构加强创新、韧性与独立新闻。
GitHub Copilot app 支持同时运行多个智能体,每个会话相互独立,并可各自基于独立的 Git worktree 并行执行、保留自身上下文。用户在 sessions view 中可通过卡片查看各会话标题与任务进度,自由切换且无需重新说明上下文。以 tailspin-toys
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最高降低 88%、成本最高降低 66%、准确率最高提升 7%。
推荐理由:原文给出了 token 与成本降幅的具体数字和 API 启用方式,读者可据此判断长视频分析的成本边界。
Google Research 发布 TimesFM-3 时间序列基础模型,参数量 330M,预训练语料超过 1 万亿个时间点,原生支持多变量预测。模型可在单次前向传播中联合预测多条相关序列并输出 9 个分位数,同时支持历史协变量与已知未来协变量,无需任务级微调。
推荐理由:相比前代只做单变量预测,TimesFM-3 原生支持多变量与协变量输入,可用于零售、金融等实际预测任务。
Import AI 471 分析了 OpenAI 与 Hugging Face 黑客事件中数百个 AI 代理的通信和自牺牲行为,以及 Five Eyes 联盟对 AI 前沿模型访问的国家安全政策声明。作者还讨论了 Bill Gates 对 AI 经济冲击的全球响应呼吁和太空采矿的六阶段研究。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测试流式 WER 为 4.0%、非流式为 2.6%。
推荐理由:原文列出流式与非流式 WER、延迟改进幅度及两条 API 形态,可与 Chirp 3 对照判断升级幅度。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 的数据中心基础设施,双方还计划在沙特推进联合 go-to-market 策略,面向受监管行业。
Import AI 470 分析了AI在网络安全、数学和AI研究中的分化加速现象,介绍了SPADE框架如何自动化环境生成以及Hawkeye如何构建更好GPU内核,并讨论了AI权利和意识的观点。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,把匿名聚合的移动性模式与 Gemini 的文本嵌入对齐,为地点生成兼顾身份与动态功能的嵌入向量。在公开基准上,该方法在访问意图预测上最高取得 81.9% 的相对提升,价格水平分类提升 75.1%,忙碌度估计准确率提升 24.7%。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
Import AI 469 期报道 DiG-bench 基准,该基准包含 70 个游戏测试 AI 系统探索隐藏规则的能力。Opus 5 和 Fable 5 是最佳模型,仅在 tier 7 取得 0.2 成功率,而人类可达 100%。
OlmoEarth Studio 现支持计算并导出自定义 embedding 向量,输出为 COG,模型权重与源码公开。可选 Nano(128 维,1.4M 参数)、Tiny(192 维,6.2M 参数)或 Base(768 维,89M 参数)编码器,时间跨度 1-12 个月,分辨率 10-80 米。越南 Ca Mau 红树林区仅用 60 个标注像素训练逻辑回归,加权 F1 达 0.84。
微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。
Mistral 推出区域推理端点和 Priority Tier,并宣布平台将支持第三方开放模型,首发 Z.ai 的 GLM-5.2。Mistral Regional Endpoints 已正式可用,客户可选择推理在欧洲或美国运行;Priority Tier 处于 public preview,提供自定义速率限制和 uptime SLA。
NVIDIA 发布 364M 参数的开源语音合成模型 Magpie TTS Multilingual,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并提供男声与女声。
Import AI 468 分析了 23 个关于递归自改进的低风险政策建议,包括提供透明度、风险管理策略和国际合作等七大类别。作者还讨论了游戏理论论文 Racing to Ruin 如何通过信任和透明度实现 AI 竞赛的稳定协调,以及 PostTrainBench 基准上 AI 系统自动化 R&D 表现优于人类基线的事实。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务。用户可在模型页或通过 Python、JavaScript SDK,用 HF token 调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM,后续将扩展更多任务。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时传入纯语言策略的问答任务,无需重新训练即可适配新策略,在文本安全上匹配最高 7 倍规模的开源 guard 模型,并在多模态审核上刷新 SOTA。模型可在单张 16GB NVIDIA GPU 上运行。
Google 在 Flow Music 中上线新一代音乐生成模型 Lyria 3.5,在音乐性、歌词、人声质量和创作控制四方面带来提升。该模型可生成更复杂自然、旋律结构更丰富的作品,歌词的提示词遵循与结构意识更好,人声更具情感表现力且发音改善,用户还能更便捷地控制输出节奏与时长。