1. Google 发布 Gemini 3.8 与网络防御版 (Gemini 3.8 Flash and 3.8 Flash Cyber)
Google 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber。普通版定位为低成本的通用模型,侧重软件工程、代理任务和多步推理;每百万输入、输出 token 首发价分别为 0.75 和 3.75 美元。Google 称其 HLE-Verified 得分为 54.9%,在长时程工程任务上接近更昂贵的模型;高 effort 会因增加推理和工具调用而消耗更多 token。Cyber 版用于漏洞发现和自动补丁,先向 Fairwind Program 中受信任的政府机构、关键基础设施运营方和软件维护者开放。它在 CyberGym 上达到前沿水平,在覆盖 20 种编程语言的内部评测中成功率超过 70%;CWE-Bench 的 pass@1 为 47.2%。两版采用不同强度的攻击滥用防护,普通版已进入 Gemini API、AI Studio 等产品。
论坛讨论链接:https://news.ycombinator.com/item?id=49537553
讨论集中在速度、前端生成质量与可信度。Simon Willison 称,一个简单提示用 13 秒、约 1.8 美分生成了 HTML;他随后又让模型给自己的 Markdown 渲染工具补上 HTML 支持,认为完成度不错。有人却发现演示把“60 FPS”直接写死,质疑生成结果会用表面效果掩盖实现问题。另一人主张逐行检查代码;也有人建议交给第二个代理复核,但承认它可能报出大量细枝末节,仍需人工筛选。围绕模型是否具有“欺骗意图”,评论者也出现分歧。
2. Perplexity 引用了批量生成的“最佳软件”页 (Three sites made 215,128 “best software” pages for AI. Perplexity cites them)
Trellner Research 审计 Perplexity 的软件推荐来源。研究设置 380 个软件类别,调用 sonar 与 sonar-pro 共 760 次,取得 3,800 个推荐位置、1,807 个产品及 7,534 条引用,覆盖 2,055 个域名。59.8% 的引用来自 Tranco 十万名之外的网站,23.4% 来自未进入前一百万的域名。Guideflow 不属于大多数被询问的软件类别,却凭“最佳软件”文章被引用 194 次、覆盖 96 类,成为第三大来源。wifitalents.com、worldmetrics.org 和 gitnux.org 因基础设施、模板与分类相似,被推断可能由同一方运营,合计生成 215,128 个相关页面。报告强调,这不证明低流量网站质量差,也没有验证移除这些页面会改变推荐;样本只覆盖两个模型、单日索引、每类一次请求和一种提示词。
原文链接:https://trellner.com/reports/manufactured-sources-behind-ai-recommendations/
论坛讨论链接:https://news.ycombinator.com/item?id=49536375
评论者把报告与“模型偏爱模型生成文本”的观察联系起来。有人称,Claude 比较自己先前生成的代码与人工重构版本时总选前者,搜索也常纳入批量生成网站;另一人以文字冒险实验补充,注入草稿区的正确提示常被忽略或删除,模型自产文字反而较稳定,并推测外来文本因概率较低而容易被视为异常。回复者有人类比人会排斥违背既有信念的信息,有人建议先让模型改写提示,也有人认为这可能是防御提示注入或数据投毒的副作用。这些都属于个人实验与机制猜测。
3. 如何退出 Mistral 数据训练 (Can I opt out of my input or output data being used for training?)
Mistral 文档称,在某些情况下,对话、文档等输入输出会进入训练计划,用户可以随时退出。普通 Vibe 默认未退出,也就是交互数据可用于训练;Vibe Enterprise 默认不参与。网页端可在管理后台进入 Vibe 的 Privacy 设置,关闭允许交互用于模型训练的开关;iOS 和 Android 用户可在 Settings 的 Data & Account Controls 中取消数据共享。Mistral Studio 与 API 使用另一组设置,需要在 Privacy 中关闭“Anonymous improvement data”。Vibe 与 API 的退出开关互不联动,上传或附加到 Vibe 的文档也算输入。文档称,退出确认后,Mistral 不再将相应输入输出用于训练。
论坛讨论链接:https://news.ycombinator.com/item?id=49535284
发帖者称,其机构因看重欧洲供应商与集中隐私控制而选择 Mistral,并由 Pro 升至 Team;此后发现 Team 似乎也默认允许训练,组织级关闭选项一度消失,测试提示词曾被用于训练,交涉后由 Mistral 移除。他还说帮助页与实际设置曾冲突数日。回复者则称,非 Enterprise 账户也有 Vibe 和 Console/API 的组织级开关,自己关闭后一直有效。发帖者承认误用了 opt-in、opt-out,但仍表示后台没有该开关。焦点由此落在文档、套餐说明与账户界面是否一致。
4. Meta 发布 Muse Spark 1.3 (Muse Spark 1.3)
Meta 于 9 月 2 日发布 Muse Spark 1.3,并已将其接入 Muse Code 与 Meta Model API;最高推理档位仍需完成额外安全测试。新版基于数月实际使用反馈,公告重点落在编程与长时程代理协作。模型可同时推进多个工作流,从混乱或冲突的材料中整理上下文,发现计划缺口后修正,并持续记录已掌握的信息。面对歧义、阻塞或可能产生后果的操作,它会分别选择提问、求助或请求确认;用户中途追加要求时,也更能将新指令归入正确任务并保留长指令约束。Meta 称,1.3 对能力边界的判断更准确,较少虚报完成;内部工程师比较显示,它在常见工程流程中比 1.2 少用约 20% 的工具调用和 25% 的 token。安全方面还增强了对抗输入、提示注入和不可逆操作风险识别。Meta 同时预告更大模型及开放权重版本,但未公布日期。
原文链接:https://developer.meta.com/ai/models/muse-spark/
论坛讨论链接:https://news.ycombinator.com/item?id=49541256
讨论围绕 Simon Willison 的“鹈鹕骑自行车”SVG 测试。他用 4.2266 美分、38 秒生成一幅图,认为 1.3 在车架、翅膀等细节上优于 1.2;xhigh 档耗资 7.5 美分、用时 1 分 34 秒。有人追问,为何提示词未指定构图,各模型仍画成侧视、向右骑行和平地。回复认为,宽泛提示会趋向训练资料中的常见样式,早期案例被后续模型吸收后可能继续强化。另有人用 POV-Ray 测试指出,模型对车轮方向等空间关系薄弱;也有人认为,它处理样本较少、长期稳定的 DSL 已算不错。
5. 老化大脑会把记忆片段混在一起 (Aging brains blend memories together instead of just forgetting them)
一项发表于《Cerebral Cortex》的研究分析年龄增长如何改变海马体对情景记忆的重新激活。研究纳入 61 名 18 至 74 岁参与者,其中年轻、中年和老年组分别为 17、21、23 人。参与者在核磁共振扫描中学习“人脸—物体”或“人脸—场景”配对,静息后从四个选项中找回组合,错误分为同类别误选和物体、场景之间的跨类别混淆。年轻组总体准确率高于中老年组;在年轻人中,学习与回忆阶段的海马体活动模式越相似,通常记得越准。老年组却没有这种优势,较高相似性反而伴随更多跨类别误配。研究者据此推测,老年记忆问题可能不只有痕迹变弱,还包括提取范围过宽:大脑唤回了经验的大类,却丢失细节边界。海马体体积、基础活动组织和注意力未能完整解释该现象。论文也提醒,样本在约 30 至 50 岁间有空档,模式相似不等于直接观察到记忆重放,且各年龄组表现大量重叠,结论不能外推到所有老人。
原文链接:https://studyfinds.com/aging-brains-blend-memories-together-instead-of-forgetting-them-study-finds/
论坛讨论链接:https://news.ycombinator.com/item?id=49535548
评论区收录的一条长评提出另一种解释:记忆错误也许不完全来自生物老化,而与一生持续累积的记忆让存储系统逐渐“变满”有关。评论者把记忆想象成高维嵌入,由多神经元组合以内容寻址方式保存;同一组合承载的信息越来越多时,原本可区分的记忆可能发生碰撞,回忆准确率随之下降。他用没有溢出机制的哈希表作类比:容量接近上限后,碰撞和“错误回忆”都会增加。评论者也明确承认大脑不是计算机,这只是帮助思考的模型,没有证据证明“容量耗尽”就是论文观察到跨类别混淆的原因。
6. 为什么别轻易放弃 Firefox (Hang on to Your Firefox)
作者借“别把孩子和洗澡水一起倒掉”,反对因 Mozilla 的个别选择弃用 Firefox。一位博主因 Firefox 出现在 X 而转用 Vivaldi;但 Vivaldi 也运营 X 账号,还使用 Meta 的 Threads、Facebook、Instagram 与 Google 的 YouTube。文章的核心论点是浏览器引擎多样性:若 Firefox 继续衰退,市场会进一步被 Chrome 及其衍生浏览器占据,Vivaldi 也在其中;独立选择只剩 Safari,而它的位置主要来自 iPhone 的默认浏览器政策。作者推测 Firefox 加入 X 是为了接触新用户。面对很小且仍在下降的市场份额,用户不应因此离开,反而应继续使用它来维持竞争。
原文链接:https://www.newsonaut.com/articles/hang-on-to-your-firefox
论坛讨论链接:https://news.ycombinator.com/item?id=49527748
收录的评论反驳了“批评者想得太多或可能是机器人”:正因为 Firefox 对竞争重要,资深用户才会在 Mozilla 收购广告技术公司、收集数据、推动个性化广告,以及加入被视为反功能的设计时持续抱怨。评论者尤其不满用户为恢复体验而查找文档不足的 about:config 设置,甚至修改 userChrome.css。他认为这些声音来自对 Mozilla 优先级和 Firefox 走向的担忧;HN 上有相关开发者和员工,公开反馈或许会被看到,而技术用户又常关闭遥测,因此这种表达更重要。
7. Commodore 64 发布四十四年 (Commodore 64 released September 1, 1982)
Commodore 64 于 1982 年 9 月 1 日发布,名称来自 64KB 内存,也是首台售价低于 600 美元的 64KB 电脑。不过出货时间并不确定:当年 1 月消费电子展展示的仍是原型机,有工程师称 8 月少量出货;圣克拉拉生产遇到质量问题后转交日本 Kentron,至 1983 年 1 月量产。产品半年内卖出五十万台,1984 财年末约五百万台,总销量约 1230 万台。它原按三年寿命规划,却在八十年代末仍年销约七十万台,并延续到 1993 年。机器也有妥协:磁盘驱动器偏慢,SID 声音芯片因晶圆空间只容纳三声部,但每声道音量控制和复杂波形能力让程序员不断突破影音表现。作者回忆自己用它学习 BASIC 与 6502 汇编、完成作业并进入 IT 行业。2025 年,取得 Commodore 品牌的 YouTube 创作者又推出基于 FPGA 的替代主板,约售出 1.9 万台。
原文链接:https://dfarq.homeip.net/commodore-64-released-september-1-1982/
论坛讨论链接:https://news.ycombinator.com/item?id=49533497
讨论集中在早期家用电脑如何改变个人道路。有人 1984 年从叔叔处得到 C64,从游戏和第一段 BASIC 代码开始,认为它塑造了自己的思考方式;也有人说原版参考手册和用户指南直接影响了职业选择。一条支线谈到竞品 TRS-80 CoCo:它没有使用 Z80,而是采用 6809E 处理器,有人的机器升级到 64KB。另一位读者少年时买不起磁带存储,每次都逐行重输小程序。还有人把大学数据结构课程的优势归因于 C64 上的 BASIC 经验,并称父母支付最初的 595 美元是对自己最值得的一次投入。
8. 泊松圆盘采样的算法与两项改进 (Poisson Disk Sampling)
普通随机撒点可能让对象重叠,泊松圆盘分布则要求任意两点至少相距 r。文章拆解 Bridson 方法:将 d 维空间划成边长 r/√d 的网格,维护活动点列表;每次选一点,在距其 r 至 2r 的环带内最多试采 k 个候选,合格者加入网格和列表,连续失败便移除活动点。环带半径不能直接均匀抽取,需要按体积做逆变换。作者给出两项提速:二维时记录新点的父点,排除必然落入父点禁区的角锥;另一项用参数 c 改写半径累积分布,让采样靠近内圈,并依 k 给出经验式 c=-1.4-17/√k,在点密度与随机性之间折中。固定 r 还可改为随位置变化的函数,用于生成明暗疏密不同的点描。最后介绍 Mitchell 2022 年方案:选择仍有空间的网格单元,将其拆为三角形或弧边区域后采点,再挖去半径 r 的禁区,以获得最大性、均匀性和确定性;文中也提到适合 GPU 并行的 PixelPie。
原文链接:https://stripeacross.com/posts/poisson-disk-sampling/
论坛讨论链接:https://news.ycombinator.com/item?id=49536177
评论者称交互可视化直观易读,尤其喜欢树状渲染,并补充 Casey Muratori 用蓝噪声及确定性方法放置游戏草地、Observable 示例等资料。一名读者说 Bridson 算法依赖活动列表,无法在着色器中逐像素实现,只好用网格哈希和单元内抖动;回复指出正文已链接 GPU 实现 PixelPie。另有人澄清图中 p、q 都是既有点,真正要选的是第三个候选点。讨论还区分泊松圆盘与低差异序列:前者大致填满区域并生成目标数量的点,后者通常逐点扩展到任意长度,改造后也未必比专用方案合适。
9. 走出洞穴,让成果接受现实检验 (Exit the Cave)
Justin Andersun 用“洞穴”比喻舒适的私人训练状态:人可以独自练习、记录投入、打磨产品或身体,却迟迟不让成果接触外界。智能设备奖励可量化的个人训练,推荐算法强化既有观念,AI 也常顺着用户预设回应,于是可控制的努力容易被误当成真实进展。他以高中摔跤经历说明这种偏差:自己长期减重、练技术和体能,比赛却仍经常失利。投入并非无效,问题是他把做好可控输入等同于必然获胜,同时更在意不让队友失望和躲避羞耻,没有直面自己是否真正渴望胜利。真实对手会揭露目标、动机与方法之间的错位,这是私人叙事无法替代的反馈。文章随后把摔跤垫扩展到其他领域:写作者需要读者,创业者需要客户,运动员需要比赛,关系也包含被拒绝的可能。作者主张结束无休止的准备,发布产品、分享作品、进入竞争;公开失败虽难受,却能检验练习是否有效。
原文链接:https://turtlespace.blog/p/exit-the-cave
论坛讨论链接:https://news.ycombinator.com/item?id=49536606
讨论出现两条不同方向。一位读者没有谈抽象隐喻,而是讲述独自进入熔岩隧道的经历:他在黑暗中关掉手电、静坐落泪,出来时因暖空气和阳光感到强烈振奋;回复随即转向洞穴安全,建议携带三支手电并分开放置,避免一次全部遗失。另一位读者直接反对“有价值的追求都需要赛场”,认为进步可以由自己相对昨天的变化衡量,不必以是否对别人有用为准;日记无需变成回忆录,保持健康也不一定为了竞争。他还指出,私人经营游戏或个人爱好并非无意义,公开比较财富、地位的行为反而更像无谓磨耗。
10. 冷战实验室留下的名片网络 (A Selection of Los Alamos Rolodex Business Cards)
“Los Alamos Rolodex”是七只来自洛斯阿拉莫斯国家实验室未知办公室的旋转名片夹,品牌为 Dial-A-Card。它们出现在剩余物资商店 Black Hole 的设备堆中,保存着 1967 至 1978 年间按公司名称排列的数千张名片。所列企业从清洁用品供应商延伸到先进材料工程公司,留下核研究设施建设、维护与外部商业世界的往来记录。美国土地使用解释中心取得资料后,将其收入犹他州温多弗的 Atomic Archive,并送往欧洲等地展出。2015 年 12 月,洛杉矶展览按年份陈列近 500 张卡片及四只原名片夹;2016 年活动又展示一百多张,并请观众补充人物和公司的记忆。配套出版物按原尺寸收录约 150 张。后续调查发现,不少电话已停用,公司改名或被收购,地址也已易主;一些持卡人的子女和旧同事则因展览联系策展方,使日常卡片成为追索工业网络、平面设计和个人经历的历史材料。
原文链接:https://clui.org/collections/los-alamos-business-cards/selection-cards
论坛讨论链接:https://news.ycombinator.com/item?id=49513856
一名看过实体展览的评论者补充了 CLUI 2016 年通讯和配套书籍,并推荐其洛杉矶卡尔弗城展馆。有人沿 FerroFluidics 的 Ronald Moskowitz 名片调查,发现此人后来因证券欺诈被判八年监禁,另一位读者也曾被同一姓名吸引。设计讨论集中在老名片的标志、色彩与简洁排版,不少人认为它们比当下或平淡、或过度装饰的宣传物更好记;话题继而转到路边和餐馆使用生成式图片,有人担心食物图失真并误导顾客。另有读者指出,旋转夹会遮住部分联系方式,建议把电话和地址放到卡片上方。