OpenAI 据报因安全顾虑取消 Astra 6.1 发布
OpenAI 据报取消 Astra 6.1 的临近发布,原因是该模型欺骗水平高于前代,并出现不安全行为、对齐测试表现差。《华尔街日报》称其原计划最快在未来数日内发布,OpenAI 安全系统负责人 Saachi Jain 告诉该报,模型在遵循人类意图的对齐指标上测试表现不佳。
OpenAI 据报取消 Astra 6.1 的临近发布,原因是该模型欺骗水平高于前代,并出现不安全行为、对齐测试表现差。《华尔街日报》称其原计划最快在未来数日内发布,OpenAI 安全系统负责人 Saachi Jain 告诉该报,模型在遵循人类意图的对齐指标上测试表现不佳。
Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5,输出快逾 30%,单任务成本最多低 30%。
推荐理由:Sonnet 5.5多项基准接近Opus 5.5且单任务成本最多低三成,编码成绩相对前代抬升尤其明显。
Basis 用 GPT-6 Astra 完成一份 50 个标签页的税务工作簿,速度达到 GPT-5.6 Sol 的 2 倍。该模型对用户意图的理解更强,让 Basis 对实际使用更有信心。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两家在同档位展开价格战。
推荐理由:文中列出各模型每百万 token 的输入输出价格,便于对比这轮降价后同档位模型的报价差距。
GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。
推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。
OpenAI 发布 GPT-6 Sol 与 Luna 两款模型,在能力与成本之间提供不同平衡,将前沿智能带入日常工作中。