Skip to content
Go back

小米开源 MiMo-V2.6:万亿参数多模态模型瞄准自我改进 | Hacker News 摘要 (2026-09-22)

Published:  at  08:04 PM

1. 小米开源 MiMo-V2.6:万亿参数多模态模型瞄准自我改进 (MiMo v2.6)

小米 MiMo 团队发布并开放 MiMo-V2.6 系列权重,旗舰版 Pro-RL 采用稀疏混合专家架构,总参数约 1.02 万亿、单次激活 420 亿参数,支持 100 万 token 上下文,并把文本、图像、视频和音频放进同一模型。官方称新一代的重点不是单纯扩大模型,而是同时扩大强化学习计算、训练环境和评分器:编程、通用智能体、视觉及网络安全任务被放在一次混合强化学习中训练,再用组内智能体评分比较已经通过测试的多条轨迹,奖励更高质量、更短的求解过程。同步开放的还有 Flash-RL 与基于 Qwen 的 9B 蒸馏版,模型采用 MIT 许可证,并提供 SGLang、vLLM 部署方案。上述参数来自小米 MiMo 官方模型卡,官方自报基准仍有待独立测试。

原文链接:https://mimo.xiaomi.com/mimo-v2-6

论坛讨论链接:https://news.ycombinator.com/item?id=49792730

HN 讨论最看重的并不是某一项跑分,而是团队公开训练过程的方式。有评论者称实时强化学习仪表盘和技术报告很适合作为教学材料,尤其难得的是连表现不佳的项目也一并披露。由此延伸出的设想是让分布式机器共同参与训练,并用某种凭证或收益回报贡献者;反对者随即指出,这会带来恶意数据注入、版权归责、创作者分成和 AI 内容反复污染训练集等问题。另一位评论者认为,若能追踪每台机器贡献的数据及其与其他来源的一致程度,或许能建立信誉和付费机制,但也承认工程与治理都很复杂。


2. Grok 4.7 发布:更大底座、价格不变,主攻编码与知识工作 (Grok 4.7)

SpaceXAI 发布 Grok 4.7,称其换用了比 4.6 更大的基础模型,面向长时间编码任务、文档制作和专业知识工作,并加强自检与安全防护。价格仍为每百万输入 token 2 美元、输出 token 6 美元,另有输出速度翻倍、价格也翻倍的快速版本。官方数据中,Grok 4.7 在 CursorBench 4.0 得分 46.3%,高于 4.6 的 40.4%;DeepSWE v1.1 为 71.0%,Terminal-Bench 4.0 为 38.0%,均显示长任务能力提升。安全部分称,新防护栈在危险网络安全提示上只放行 3.3%,同时尽量避免误拒绝合法防御工作。模型已进入 Cursor、Grok Build 与 API。上述性能和“同价更强”的判断主要来自厂商基准,真实成本效益仍需结合工作负载验证。

原文链接:https://x.ai/news/grok-4-7

论坛讨论链接:https://news.ycombinator.com/item?id=49788838

HN 上最具体的争论围绕“基准与实际体验是否一致”。一位用户称新模型参数规模据说增加约四成、价格却没变,但他对发布延期及竞争对手即将更新作出负面推测,同时又承认上一代 Grok 曾解决其他模型未完成的 Buildroot 问题,前端开发也很好用。这恰好说明用户已不再完全相信排行榜。讨论还集中在语言风格:有人喜欢 Grok 的直白,也有人觉得它过于简略,会突然使用只在内部推理中出现的术语。关于是否显示思考过程,支持者认为可帮助理解错误,反方则担心长工具链里信息太多。


3. Cloudflare Python Workers 正式可用:主流框架直接跑在边缘 (Python Workers are now generally available)

Cloudflare 宣布 Python Workers 结束两年预览并正式可用,Python 成为其开发者平台的一等语言。开发者可直接连接 Workers AI、R2、D1、Hyperdrive、Durable Objects,也能通过内置 ASGI、WSGI 连接器运行 FastAPI、Django 与 Flask,无需另起 Web 服务器。新版绑定层自动完成 Python 与 JavaScript 对象转换;TCP socket 桥接让常见数据库驱动经 Hyperdrive 访问 PostgreSQL 或 MySQL。平台仍以 Pyodide 和 WebAssembly 沙箱为基础,并推动 PEP 783 与 PyEmscripten 支持,扩大可用软件包范围。Requests、OpenAI SDK、LangChain 和 MCP 等库也可经 JavaScript fetch 工作。

原文链接:https://blog.cloudflare.com/python-workers-ga/

论坛讨论链接:https://news.ycombinator.com/item?id=49787142

HN 关注“能运行”背后的兼容性债务。urllib3 维护者说明,Pyodide/Emscripten 支持由外部贡献者开发,合并后长期维护责任却落到上游项目;该后端仍属实验性,JavaScript fetch 与 urllib3 原有语义也不同,过去已出现重定向漏洞。另一位开发者担心 JS 事件循环和 Python 协程模型行为不同。Cloudflare 工程师回应,Python 协程依旧惰性执行,采用 JS 循环是因为实际 I/O 事件在那里发生,另起循环反而会阻塞 I/O。核心问题是谁承担长期适配成本。


4. 斯诺登档案为何沉寂:最后一份文件停在 2019 年 (What happened to the Snowden archive)

一篇长篇调查追溯斯诺登档案从分散交给多家媒体,到最终停止发布的过程。现有记录显示,完整或部分副本曾由 Laura Poitras、Glenn Greenwald、Barton Gellman 以及《卫报》《纽约时报》《华盛顿邮报》《明镜》等机构持有;为保护材料,记者曾使用断网电脑、拆除无线模块、加密卷、分离保存密钥和高安全房间。公开文件的最后一次更新出现在 2019 年 5 月。文章重点审视 The Intercept 当年关闭专门研究团队的决策:内部先后出现预算削减、档案新闻价值下降、编辑重点变化以及寻找学术机构接手等不同解释,Poitras 则称决定仓促且没有充分咨询关键持有人。作者认为,“材料过时”和“其他媒体早已停止”都不足以解释全部过程,尚未公开部分更像需要长期研究的历史档案。

原文链接:https://libroot.org/posts/what-happened-to-the-snowden-archive

论坛讨论链接:https://news.ycombinator.com/item?id=49780820

HN 的情绪明显偏失望,但具体归因并不一致。有人认为斯诺登把材料交给可信记者后,档案最终在组织利益、个人冲突和执行失误中逐渐失去动力,这削弱了他对媒体机构的信任。另一条讨论把问题归因于更广泛的信息过载:普通人既被娱乐和消费分散注意,也可能正面对住房和收入等更直接压力,因此即便监控真相已经公开,也难持续形成政治行动。关于斯诺登本人,有人希望未来能获赦回国,反方则认为现实政治阻力仍大;还有评论猜测其现居地是否会限制离开,但随即有人指出,泄露材料本身早已独立存在,不能简单把个人处境等同于档案影响。


5. 注意力才是稀缺资源:如何找回主动选择的互联网 (Attention is all you have)

作者从“俄罗斯方块效应”出发:长期把注意力放在哪里,人的感知和思维就会逐渐被什么塑形。问题在于,如今视频、音乐、职场社交和商品讨论越来越由推荐算法安排,用户原本只想看菜谱、听歌或了解同事近况,却会被情绪更强、停留时间更长的内容不断牵引。作者把这比作把进入大脑的钥匙交给平台。作为替代,她回忆推荐流普及前的网络:用户通过书签主动前往新闻站、教程、博客和 Wiki,恶劣内容同样存在,但需要自己寻找,而不会自动排在猫视频之后。回到这种“有意图的互联网”并不需要彻底退网,而是重新使用博客、RSS 和教程,接受内容有限、更新较慢,并通过重复练习把主动选择恢复成习惯。

原文链接:https://alicegg.tech/2026/09/21/attention

论坛讨论链接:https://news.ycombinator.com/item?id=49787726

HN 讨论从注意力延伸到浏览器为何没有帮助人管理长期记忆。一位评论者指出,1993 年的 Mosaic 已有全文历史搜索,但此后的书签仍像需要手工维护的目录;网站消失后,浏览器通常既不保存文本版本,也不会自动寻找存档。他希望本地历史与相似页面搜索能让旧链接可恢复。回复者认为书签衰落并不只是产品失误,人们普遍厌恶与目标无关的整理工作。Gmail 依靠全文搜索成功,应用也用直接入口替代文件管理;因此更现实的设计不是要求人人勤做分类,而是让本地搜索、存档和恢复默认发生。


6. Kev 发布小型决策模型:在本地输出分类概率而非一句答案 (Kev: Tiny Jev-like family of decision models built on top of Qwen3.5)

开源项目 Kev 推出基于 Qwen3.5 的 0.8B、4B 和 9B 决策模型,目标不是生成长文本,而是对同一段状态信息回答多个是非、选项或评分问题,并返回每个选项的概率。每个问题能读取共同输入,却不能看到其他问题,从而减少相互污染。模型由 LoRA 适配器和小型指针头组成,基础权重保持冻结,训练代码、评测数据和 Apache 2.0 权重均已公开,可在 CUDA、ROCm 与 Apple Silicon 上运行。项目建议从 4B 版本起步;9B 在新来源测试集上达到 0.852 准确率,但仍落后托管的 Jev,而且在 Mac 上约需两秒。作者强调概率经过温度校准,却不能消除错误或选项顺序敏感性,正式自动化前仍应在自有数据上确定阈值。

原文链接:https://github.com/jaredpalmer/kev/tree/main

论坛讨论链接:https://news.ycombinator.com/item?id=49783999

HN 提出了更小的替代路线:若任务只是分类且有几十到几百条标注数据,文本嵌入加逻辑回归可能已经足够。一位用户称邮件分类器用 50 至 100 个样本即可在 CPU 上数分钟训练,模型不足 1 MB、推理低于 100 毫秒;他在 Banking77 上也取得接近领先成绩。其他人补充,微调 ModernBERT 可把零样本约三成准确率提高到 98.2%,非线性边界可尝试 RBF SVM。讨论并非否定 Kev,而是提醒按复杂度选工具:多问题概率适合小语言模型,稳定单标签任务可能用传统分类器更便宜。


7. 交互式 Transformer 图解:在浏览器里拆开注意力机制 (Transformers Explained Visually)

佐治亚理工学院团队制作的 Transformer Explainer 用浏览器内运行的 GPT-2 Small,把文本生成流程拆成可操作的图解。用户输入提示词后,可以逐步查看分词、768 维 token 与位置嵌入、12 层 Transformer 块、多头自注意力、MLP,以及最终映射到 50,257 个词表概率的过程;还可调整温度、top-k 和 top-p,观察下一 token 分布如何变化。可视化特别展示 Query、Key、Value 的计算、掩码注意力和各注意力头的拼接,并解释 MLP 如何先把维度扩展四倍再压回原大小。工具以 nanoGPT 的 GPT-2 实现为基础,借助 ONNX Runtime 在本地推理,界面使用 Svelte 和 D3.js,因此学习者可以直接点选注意力图,而不只是阅读静态公式。

原文链接:https://poloclub.github.io/transformer-explainer/

论坛讨论链接:https://news.ycombinator.com/item?id=49792342

HN 用户最感兴趣的是一个常被入门材料略过的观察:注意力矩阵与 Value 相乘时,很像把 Value 送入普通稠密层,只不过权重不是训练后固定,而是由当前输入的 Query 和 Key 在推理时动态生成。回复者说明,传统 MLP 主要是固定参数与输入激活相乘,Transformer 注意力则引入大量输入依赖的激活彼此相乘。不过也有人指出,这种类比要求读者已经理解 MLP、却尚未理解 Transformer,受众很窄。其他评论分享更多可视化,说明交互演示能让抽象矩阵被逐步点击和观察。


8. Sun 做错了什么:技术理想输给不会做生意 (What Sun got wrong)

Oxide 联合创始人 Bryan Cantrill 借一件致敬 Sun Microsystems 的团队 T 恤,重新审视这家传奇计算机公司的失败。他承认 Sun 在技术、文化和使命感上值得怀念,但认为公司后来对“经营企业的机械工作”失去兴趣。关键案例发生在 2005 年:一家使用 OpenSolaris 的创业公司本想购买 Sun 服务器,这本应证明开放 Solaris 能带来硬件生意,Sun 却迟迟不接电话,接通后还推销错误产品。相比之下,Dell 在客户深夜填写表单后的第二天就主动联系,两周内完成配置、价格层级、交付和无需个人担保的租赁。那家创业公司后来正是 Joyent,Cantrill 离开 Sun 后加入,并与当年的客户共同创建 Oxide。他的结论是,纪念旧公司不能只剩怀旧,还应把失败当成经营警告。

原文链接:https://bcantrill.dtrace.org/2026/09/20/what-sun-got-wrong/

论坛讨论链接:https://news.ycombinator.com/item?id=49787436

HN 的亲历者认可购买体验是关键差异。一位 1990 年代采购服务器的用户回忆,Sun 和 DEC 要求现场销售会议、反复修改报价,甚至导轨和电源线都可能比次日到货的 Dell 整机更贵。但评论提醒,领先者也会复制旧巨头的问题:有人说今天的 Dell 已出现销售代表频繁更换、价格不透明和交付模糊,自己转向可在线配置且库存明确的供应商。另一条争论强调 Sun 难以类比 Dell:前者同时掌握 CPU、Unix、编译器和桌面环境,这曾是壁垒,也在 GNU/Linux 与 x86 成熟后变成负担。


9. CRT 并不会自动拯救像素画,真正起作用的是信号与技法 (The Effect of CRTs on Pixel Art (2024))

文章反驳“老游戏像素画只有放在 CRT 上才正确”的简化叙事。CRT 的确会改变画面,但效果取决于屏幕档次、点距、PAL 或 NTSC 制式,以及 RF、复合、S-Video、RGB 等输入信号;廉价电视的模糊和串色可能帮助颜色混合,后期高品质显示器却能把单个像素显示得相当清楚。更重要的是艺术家主动使用的有限调色板、抖动、抗锯齿、色彩对比和硬件技巧,这些在现代平板上仍然有效。文章还提醒,320×200 等旧分辨率在 CRT 上常以非方形像素显示,直接一比一放大会扭曲人物比例。作者认为,现代像素画的问题不是缺少滤镜,而是有人把“故意做得方块化”当成全部风格,忽略了旧时代在限制下发展出的精细技法。

原文链接:https://datagubbe.se/crt/

论坛讨论链接:https://news.ycombinator.com/item?id=49768336

HN 评论为现代像素画辩护:它已经成为面向高 DPI 液晶屏的独立审美,不必以 CRT 效果作为唯一标准。有人认为旧作品的魅力既来自怀旧,也来自当年顶尖艺术家在严格硬件限制下工作;今天独立游戏选择像素风,则更多受预算限制。另一位用户指出,清晰的方形像素本身可能是优势,它让大脑知道画面低细节是有意设计,而不是眼睛失焦或屏幕脏了。讨论也提醒“像素画便宜”并不等于容易做好:优秀作品仍需大量逐像素判断。至于生成式 AI,有人观察扩散模型尤其难稳定生成像素画,这可能暂时提高人工技法的价值。


10. 红绿灯如何工作:路口容量、感应控制与城市协同 (How do traffic signals work? (2019))

Practical Engineering 的科普文章解释,城市道路的瓶颈往往不在车道数量或限速,而在多个车流、行人和自行车必须轮流通过的平面交叉口。典型四向路口包含八个车辆流向和四个人行流向,工程师用相位及环障图组合不会冲突的动作,再根据排队长度、启动损失、车速、坡度和路口尺寸设置绿灯、黄灯及全红清空时间。现代信号多采用感应控制,通过埋地线圈、摄像头或雷达判断是否有车辆,并可优先放行公交和应急车辆。更复杂的协调控制会让一组车辆连续通过走廊,适应式系统则集中处理全城传感器数据。但容量提高也会诱发更多出行需求,因此自动驾驶和机器学习依然都无法单独消除拥堵。

原文链接:https://practical.engineering/blog/2019/5/11/how-do-traffic-signals-work

论坛讨论链接:https://news.ycombinator.com/item?id=49789081

HN 用实际路口检验文章结论。一位南非用户发现,繁忙路口信号故障后按四向停车规则通行,有时反而比灯正常时更快;另一位用户所在地区正移除部分信号灯,把多车道道路改成低速单车道并增加自行车与行人安全岛,车辆速度虽低却更连续。也有人主张更多使用环岛和降低城镇限速。另一组评论关注相邻信号协调失败:两个距离很近的路口若绿灯错开,车队会堵回上游,造成多轮无法通过,甚至在铁路道口形成危险。评论者强调稳定排队的基本条件是每周期流出量不小于流入量,否则再智能的局部控制也会累积成拥堵。


Suggest Changes

Next Post
研究者称 OpenAI 广告收集器可跨站关联 ChatGPT 用户 | Hacker News 摘要 (2026-09-21)