Skip to content
Go back

OpenAI 发布 GPT-6 Sol 与 Luna,主打更低成本的 | Hacker News 摘要 (2026-09-23)

Published:  at  08:41 PM

1. OpenAI 发布 GPT-6 Sol 与 Luna,主打更低成本的日常任务 (GPT-6 Sol and Luna)

OpenAI 发布 GPT-6 Sol 与 Luna。Sol 面向复杂专业工作、编码和计算机操作,Luna 面向更看重价格的规模化任务。官方公布的 API 每百万 token 价格为:Sol 输入 2 美元、输出 10 美元,均为前代一半;Luna 输入 0.10 美元、输出 0.50 美元,前代为 0.20 美元和 1.20 美元。OpenAI 自报 Sol 在 AutomationBench 1.0.6 的 xhigh 档成功率为 33.2%,每任务成本 0.27 美元;DeepSWE v1.1 的 max 档得分为 68.8%,Luna 为 66.6%。官方称事实可靠性和长对话缓存也有改进,缓存读取享 90% 折扣。两款模型已开放 API,并逐步进入 ChatGPT Work 与 Codex;免费及 Go 用户可在桌面端使用 Luna。数据由官方提供,评测配置和生产环境可能不同。

原文链接:https://openai.com/index/introducing-gpt-6-sol-and-luna/

论坛讨论链接:https://news.ycombinator.com/item?id=49805509

HN 讨论首先聚焦价格。Simon Willison 认为 Luna 相比上代大幅降价很有吸引力,并用同一绘图提示比较 GPT-6 与 GPT-5.6 各型号输出。另一位评论者称 Luna 在许多任务上处于性价比前沿,但其下方有人拿自身编码工作流的海量缓存读取量计算,认为按 API 计费仍可能比订阅式工具昂贵。反驳者指出,单看每 token 单价会忽略不同模型完成同一任务所需的 token 数;真正的成本应按任务成功率、消耗和缓存模式一起计算。这些是评论者的使用经验与估算,并非独立评测结论。


2. Anthropic 发布 Claude Opus 5.5,强调编码能力与任务成本 (Claude Opus 5.5)

Anthropic 发布 Claude Opus 5.5,称其在多数工作上达到 Claude Fable 5.1 的水平,完成任务成本比 Opus 5 低约 40%。官方自报:Terminal-Bench 4.0 得分 66.4%,FrontierCode v1.1 主集为 54.4%;同时提醒,高端模型间的基准分差未必能准确反映实际体验。API 每百万 token 定价为输入 4 美元、输出 20 美元,缓存读取 0.20 美元;另有价格翻倍、速度最高提升 2.5 倍的快速模式。文章还介绍了智能体操作前的动作筛查、可审计沙箱与代码审查,以及更简洁的文字表达。Anthropic 称已提高 Pro、Max、Team 和部分企业订阅的五小时用量上限,Sonnet 5.5 与 Haiku 5.5 将在随后几周推出。上述性能比较出自厂商测试,模型所用努力级别和安全设置并不完全一致。

原文链接:https://www.anthropic.com/claude-opus-5-5

论坛讨论链接:https://news.ycombinator.com/item?id=49803892

HN 热门评论没有集中讨论跑分,而是盯住 Anthropic 所说的“放缓前沿进展”。有人认为,公司刚提出放缓主张便发布新模型,又在页面列出大量性能提升数字,显得说法和行动相互矛盾。另一些评论者认为,“放缓”可以只表示比原先或可能达到的最高研发速度更慢,并不意味着暂停发布。争论随后转向措辞本身:有人觉得这个短语含义足够清楚,应该讨论实质;也有人认为缺少可衡量的速度和期限,让外界无法判断公司是否兑现承诺。当前抓取到的是该评论串的少量片段,不能据此概括所有用户意见。


3. Claude Opus 5.5 评测:智能指数 58,最高推理档成本偏高 (Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max))

第三方评测机构 Artificial Analysis 给 Claude Opus 5.5 的“自适应推理、最高努力档、默认回退”配置打出智能指数 58 分,在其所列同类模型中排名第一。这个指数汇总了知识工作、自动化、终端操作、科学代码、长上下文等十项评测,不能直接当作所有实际任务的成功率。该配置在整套指数评测中生成约 2.6 亿输出 token,同类模型中位数约 8800 万;按评测任务加权计算,平均成本为 5.98 美元。页面列出的 Anthropic API 价格是每百万输入 token 4 美元、每百万输出 token 20 美元,分别高于其比较组中位数。模型可接收文本和图片、输出文本,上下文窗口为 100 万 token;页面尚无输出速度数据。上述成绩只对应最高推理档及该机构的方法,不能直接套用于默认的中等推理档或其他提供商配置。

原文链接:https://artificialanalysis.ai/models/claude-opus-5-5

论坛讨论链接:https://news.ycombinator.com/item?id=49804316

HN 讨论集中在最高推理档的实用性。Simon Willison 指出页面评的是 max 配置;他两次要求模型生成“骑自行车的鹈鹕”SVG,都在思考阶段耗尽 12.8 万 token 而没有给出结果,因而担心简单任务也被过度推理拖垮。另有用户表示,中等或低推理档在日常工作中更划算:提高档位往往带来更长输出和更高费用,复杂问题也可拆成多个阶段。不过一位回复者认为,低档适合紧密交互,长时间自主执行任务时可能风险更高。评论者还提醒,用户看到的推理过程是整理后的摘要,不能据此判断模型原始思考。


4. WordPress 披露无需登录的路径遍历漏洞,特定条件下可执行代码 (WordPress: Unauthenticated path traversal leading to conditional RCE)

WordPress 官方安全公告披露 CVE-2026-87902:未经登录的攻击者可能利用页面模板解析中的路径遍历,使 get_page_template() 引入活动主题目录之外、服务器上可读的本地 PHP 文件。公告将其评为严重级别,CVSS 4.0 得分 9.2;远程代码执行并非所有站点都会发生,必须同时满足主题和服务器环境条件。活动子主题或父主题顶层须有以 page- 开头的目录,服务器上还须存在 Web 账户可读、可用于利用的 PHP 文件。公告举出旧版 Twenty Twelve、Twenty Fourteen 及部分第三方主题,并说明某些 PEAR 配置可将文件包含升级为代码执行。WordPress 7.1.2 已修复,补丁也回移至 4.7 起的旧分支;仍使用受影响版本的站点应按所在分支更新。发现者 Robert Ressl 通过负责任披露渠道报告了此问题。

原文链接:https://github.com/WordPress/wordpress-develop/security/advisories/GHSA-7hp8-65ch-5whp

论坛讨论链接:https://news.ycombinator.com/item?id=49803959

HN 评论既担忧漏洞,也争论怎样解读 WordPress 的风险。一些站点运维者说,公开服务器日志中经常出现探测 PHP 路径和参数的自动请求;有人认为 WordPress 普及、插件和主题可扩展,扩大了被扫描和出错的机会。但另有评论者反对从“使用广泛”直接推出“必然更脆弱”,要求区分攻击量、漏洞数量和实际成功率。有人提到公开可读的 .env 文件等配置问题,不过那不是本次公告中的漏洞。多是个人观察,不能据此认定所有 WordPress 站点都可被远程执行代码;具体影响应以官方列出的前提为准。


5. 研究者验证 GPT-6 Astra 破解一份久未解出的恩尼格玛电文 (OpenAI GPT–6 Astra breaks Enigma message that has resisted solution since 2005)

Crypto Cellar 作者称,Carter Leffer 于 9 月 15 日请他核验一份德国军队 1941 年 7 月 10 日的恩尼格玛电文 MVUEH 的破译结果。这份编号 172 的电文自 2005 年以来一直未被解出;网站作者核验后认为密钥和明文正确。它与同日另一份已破译电文 SIPVX 的内容几乎相同,但使用的转轮顺序不同,原始密文抄录也存在错误,且左侧转子在第 72 字母处进位。按作者披露,Leffer 让 GPT-6 Astra 检查网站上未解的电文;模型选中 MVUEH,推测可借用 SIPVX 的内容,并以重复的地名 ROSENOW 为已知明文线索,编写 Python 和 C++ 模拟与搜索程序后找到结果。作者仍在分析运行日志,因此具体步骤尚未完全厘清。这是研究者对单次案例的记录,所谓模型“自行完成”应连同人类提示、既有破译文本和后续人工核验一起理解。

原文链接:https://www.cryptocellar.org/bgac/the-mvueh-break.html

论坛讨论链接:https://news.ycombinator.com/item?id=49801324

HN 有人贴出破译后的德文内容并尝试翻译,讨论很快转向为何选择重复出现的 ROSENOW 作为已知明文线索。一位评论者质疑,单个地名似乎已足够罕见,寻找双重地名可能增加漏检;回复者指出,另一份已破译电文中也出现相同片段,更长的线索通常有助于筛选候选结果。另一位评论者称 Rosenow 可同时指市镇及其辖区,重复写法可能是在细化位置;这只是评论区提供的解释,原文未证明模型当时依据这一点。还有人贴出密文字符供读者核对。讨论呈现了对破解路径的技术追问,并未形成对模型自主程度的独立审计。


6. Ryzen 两年快约五成:Zen 5 靠更宽的核心和缓存提速 (How did AMD Ryzen get 50% faster in two years?)

性能研究者 Daniel Lemire 比较了 2022 年 Ryzen 7 5800X3D、2023 年 7800X3D 和 2024 年 9800X3D:三者都是八核、配备 3D V-Cache 的处理器。按 Geekbench 6 分数,首尾两款的单核成绩从 2016 升至 2969,增幅约 47%;多核从 11832 升至 18751,增幅约 58%。最大加速频率从 4.5 升至 5.2 GHz,仅提高约 15%,不足以单独解释跑分增长。作者把更多增益归于微架构扩展:晶体管数约从 110 亿增至 160 亿,最高派发宽度由每周期 6 条指令增至 8 条,每核 L2 缓存翻倍至 1 MB,L1 数据缓存增至 48 KB,重排序缓冲区由 256 项增至 448 项。Zen 5 的 SIMD 运算及加载通道扩展到 512 位。“快五成”是这组跑分对比,不代表所有程序。

原文链接:https://lemire.me/blog/2026/09/18/how-did-amd-ryzen-get-50-faster-in-two-years/

论坛讨论链接:https://news.ycombinator.com/item?id=49758709

一名 HN 用户称,他把整数回溯搜索程序的布隆过滤器调到能容纳于 L2 缓存后,单线程 IPC 从约 0.1—0.3 提到 3.0,并在 Zen 5 上测得每核心持续 6.0 IPC;这是个人工作负载的结果。其他人追问测量方法、是否使用向量指令及关闭同步多线程后的成绩,作者回复后者约为每核心 4.6 IPC。讨论解释了 IPC 在这里是“每周期指令数”,并谈到减少分支和改善缓存命中率。关于 AVX-512,有人称 Zen 5 对开发者意义重大,也有人提醒英特尔更早的处理器已支持该指令集。


7. iOS 设置页推广难关闭,苹果服务广告引发用户不满 (Apple has added persistent ‘ads’ to iOS, and it’s driving users crazy)

TechRadar 报道,一些 iPhone 用户在 iOS“设置”页顶部看到了推广 iCloud+、Apple Music、Apple TV 或 AppleCare+ 的横幅。与普通通知不同,这类提示有时没有关闭按钮;即使出现关闭选项,也有用户称操作后仍会再出现。报道说,推广可能持续数周甚至数月,设置 App 的角标也会一直保留,用户往往只能等待它自行到期,或订阅对应服务。部分优惠提示会在购买新设备后出现。文章将这种设计放在苹果扩大服务业务的背景下讨论,但没有证明所有设备、地区或版本都会遇到同样情况。另有已订阅 iCloud+ 的用户仍看到相关提示,报道认为这也可能是软件错误,尚不能据此断定苹果有意向已付费用户继续投放。

原文链接:https://www.techradar.com/phones/iphone/i-wish-apple-would-just-stop-that-crap-apple-has-added-persistent-ads-to-ios-and-its-driving-users-crazy

论坛讨论链接:https://news.ycombinator.com/item?id=49801939

Hacker News 讨论聚焦系统入口里推广自家付费服务是否损害 iPhone 的使用体验。有评论者称自己会长按 App Store 图标直接进入更新页,避开广告较多的商店首页;这一操作也让其他读者发现了快捷入口。有人借乔布斯过去反对广告的表态批评苹果方向变化,也有人提醒,乔布斯时期苹果曾推出 iAd,不能把早期苹果简单描绘成从不做广告。讨论主要是个人体验与产品取向之争,未提供设置页推广出现频率或覆盖范围的系统数据。


8. “间谍水印”概念:隐藏在图片、音频和文字里的追踪信号 (Spymarks, not Watermarks)

作者 Brandon Thomas 提议用“spymark”(可译为“间谍水印”)称呼嵌在媒体中、用户难以察觉和控制、可追溯来源或传播路径的隐藏信号,以区别于可见的版权标记和可编辑的 EXIF、ID3 元数据。文章举例说,图片像素或频域、音频波形以及生成文本的措辞选择,都可能承载标识符;标识符本身不必写入姓名,也可经后台记录关联到用户或时间。作者展示了一个将虚构 ID 173 藏入图片的教学示例,并强调该示例不能当作实际系统的解码器。此类信号可能在删除文件元数据或重新编码后仍保留,但具体效果取决于技术方案。文章担忧,若平台在上传或分发环节为不同用户植入标识,内容外传后就可能被回溯;这属于风险论证,并非证明所有平台已普遍如此操作。

原文链接:https://brand.io/article/spymarks/

论坛讨论链接:https://news.ycombinator.com/item?id=49794615

HN 读者首先争论“间谍水印”与隐写术的关系:有人认为只是给已有技术换名,另有人指出,隐写术是隐藏信息的方法,文章新词强调的是未经用户控制的追踪用途。有人建议从可信的原始文件开始逐步核对字节,但反对者指出,若信号在相机或生成模型产出内容时已写入,就没有未标记版本可比较;平台压缩图片时写入也有类似问题。评论还担忧社交平台在重新编码媒体时加入可追踪标识,不过相关具体平台行为在这组评论中未得到独立核实。


9. “我不想读你没写过的东西”:一位工程师谈 AI 代笔 (I don’t want to read what you didn’t write)

工程师 Colin Breck 在文章中抱怨,AI 生成的设计文档、工单和 PR 摘要常把大量细节铺陈出来,却没有交代为何要做、风险何在、希望读者判断什么。他认为,提示 AI 的人掌握背景材料和提问过程,接收成品的读者却缺少这些上下文,因而必须费力过滤看似完整的机器文本。作者并非反对所有 AI 写作辅助:撰写论文时,他让 AI 对照代码、配置和日志核查自己写出的段落,补全引文,检查语法并提出简化建议;论文摘要甚至直接采用 AI 版本。但让 AI 根据材料代写正文,在他的经验中既难读又容易不准。他还担心,私人沟通若被机器润色得过于周全,会失去个人声音和愿意承担误解风险的真诚。文章最后主张保留写作者的观察、取舍与不确定性,让文字呈现思考过程,而不只是压缩后的事实清单。

原文链接:https://blog.colinbreck.com/i-dont-want-to-read-what-you-didnt-write/

论坛讨论链接:https://news.ycombinator.com/item?id=49794330

HN 评论从“信息由谁负责传递”展开。一位评论者用比特数作比喻:如果写作者只给模型少量真实想表达的内容,再让模型扩写,新增字句并不能凭空补齐作者未提供的想法,反倒把筛选负担转给读者。另一位评论者把缺少来源链接的新闻摘要作类比,指出提问者能与模型反复互动,收件人拿到的却是静态结果,难以追问自己的疑点;他设想将带上下文、可继续查询的会话作为一种分享方式。跟帖又提醒,已有新闻摘要也可能误导原始文献结论。上述均为评论者的观察与设想。


10. 观点:OpenAI 可能跟进 Jev 的通用分类能力 (OpenAI is well positioned to fast-follow Jev)

Arcturus Labs 作者 John Berryman 讨论 TypeSafe 的 Jev:它试图以简洁接口对各种输入作分类或概率判断。作者认为,大语言模型本来就在预测词元,也早已借工具调用等机制执行专门判断,因此 OpenAI 有机会模仿类似产品;更进一步,它可能把经过校准的判断能力直接融入模型,在推理途中评估假设、选择下一步任务、检查工具调用风险,或决定使用何种规模的模型。文中提出的模型内部预测标签和概率均是设想,并非 OpenAI 已公布的产品计划。作者认为 TypeSafe 真正可能形成壁垒的是训练数据的构造和强化学习方法,而不是单纯模型架构;这些判断以 Jev 的准确性和可泛化性为前提。他也坦言已见到概率表现欠佳的领域,最终竞争格局仍待实测。

原文链接:https://arcturus-labs.com/blog/2026/09/21/will-openai-eat-jevs-lunch/

论坛讨论链接:https://news.ycombinator.com/item?id=49802161

HN 评论对“快速跟进”这一判断提出不同看法。一位读者说,大型 AI 公司早已在推理、安全、训练和数据处理中使用各类分类器,不一定会把它们做成公开 API;另一些人强调,固定任务分类器与 Jev 宣称的零样本通用分类并不相同。也有人指出,零样本分类并非新概念,但模型的知识面、速度、价格与易用性组合可能带来新的实用价值。讨论没有给出 Jev 与现有方案的统一基准测试,因此关于其准确性、成本优势以及 OpenAI 是否会推出竞品,仍是评论者的判断。


Suggest Changes

Next Post
小米开源 MiMo-V2.6:万亿参数多模态模型瞄准自我改进 | Hacker News 摘要 (2026-09-22)