AI 前沿每日 Briefing:2026-09-26
上诉法院维持五角大楼将 Anthropic 列为供应链风险(309 赞/513 评论);荷兰政府 910 赞拿下当天最高赞,基于 NixOS 自建微软办公替代;加州财富税 792 条评论吵翻;微软撤出个人 AI 助手赛道;rr 作者因 AI 加速辞职离开谷歌;Meta Muse 被发现调用 OpenAI 模型;Claude 花 1000 美元完成九圈散射振幅计算;Anthropic 把 Claude 送进埃博拉疫区的疫情日报流水线;CMU 教授因 AI 重做整门课;agent plan mode 之争;CUDA kernel 自动调优;Docker 云沙箱、Go 跨平台 SIMD、Rails World 争议、Topcoat v0.9、git-bug、Typst 0.15;谷歌 TPU 上天、Oracle 数据中心合同纠纷、ASML 欧洲零订单、Avast 沙箱被打穿。
2026-09-25(UTC)的 HN 首页 88 条,其中 23 条评论数超过赞数。今天的头名是上诉法院维持五角大楼把 Anthropic 列为供应链风险;荷兰政府以 910 赞拿下当天最高赞,要基于 NixOS 自建微软办公环境的替代品;行业侧微软撤出个人 AI 助手赛道、rr 作者因不愿给 AI 加速而离开谷歌;工具侧 Go 跨平台 SIMD、Rails World 主题演讲争议、Claude 九圈散射振幅各有一条硬货。本版补入 Anthropic 参与刚果(金)埃博拉响应、CMU 教授因 AI 重做整门课、agent plan mode 之争、CUDA kernel 自动调优、Jev 校准长文和 VS Code 圆角风波,共 30 条。
1. 513 条评论!上诉法院维持把 Anthropic 列为供应链风险
给模型装安全锁,也算危害国家安全了?
美国联邦上诉法院(哥伦比亚特区巡回法庭)维持五角大楼依据《联邦采购供应链安全法》把 Anthropic 列为供应链风险的决定,309 赞、513 条评论。背景:Anthropic 与国防部签约时对 Claude 用途设限:不用于大规模国内监控、武器瞄准须有人类监督;国防部要求取消这些限制,谈判破裂后将其列入风险名单,禁止国防承包商使用其产品。Anthropic 起诉称该认定属报复、不符法条对「对手方」的界定;多数意见认为条文覆盖「任何人」,且「国防部有理由担心 Anthropic 会操纵 Claude 的设计」;异议法官则认为「操纵」应指恶意行为,安全护栏不算。这是该条款首次用在一家美国本土公司身上。做政府或国防相关 AI 采购的,这份判决书值得通读,它决定安全条款在合同里还守不守得住。原文 · HN 讨论
2. 910 赞当天最高!荷兰政府要自己造一个微软替代品
办公软件也能自己攒一套出来?
荷兰政府发起 DAWO 项目(Digitale Autonome Werkplek Omgeving,数字自主工作环境),910 赞、531 条评论,当天赞数第一。目标是以组件化方案替换政府的微软数字办公环境:操作系统层基于 NixOS,配套 AI、云与协作组件,代码放在 code.overheid.nl 和 Codeberg 上,由政府、产业界与社区共建。据 itsFOSS 报道,直接起因是微软停止向国际刑事法院(ICC)提供办公软件服务。公开页面上还没有用户规模和上线时间表。管企业 IT 采购和做开源桌面方案的,这个国家级 NixOS 桌面样本值得蹲后续。原文 · HN 讨论
3. 792 条评论吵翻!加州要对已经搬走的富豪追税
人都跑了,税找谁收去?
加州「亿万富翁财富税」已进入今年 11 月选票,276 赞、792 条评论,评论数当天第一。土地经济研究中心的测算:加州土地总值约 8.14 万亿美元,是应税亿万富翁财富的约 8 倍;0.25% 的土地价值税即可筹到财富税承诺的每年 200 亿美元。作者认为财富税的税基被高估近一倍:Page、Brin、Thiel 等六人(合计约 5400 亿美元)在 2026 年 1 月 1 日截止日前已迁走,Zuckerberg(约 2200 亿美元)之后搬迁且可能挑战追溯条款;税基缩水后税率得提到 1.6%–1.9% 才筹得够数,进一步加速迁走。根子是 1978 年 Proposition 13 冻结了房产税评估,收入税被迫补位到全美最高。做美国业务选址和投资的,这条税率走向直接影响成本测算。原文 · HN 讨论
4. 微软不陪跑了!Copilot 撤出个人 AI 助手赛道
三千万付费用户也养不起一个聊天框?
彭博社报道微软放弃与前沿厂商正面竞争个人 AI 聊天助手,转向重启 Copilot 产品线,69 赞、59 条评论。数据:截至 6 月底 Copilot 付费订阅超过 3000 万,绑定 M365 套件的付费用户约 9000 万。HN 评论区的用户反馈更难看:多人报告企业版 Copilot 对话历史被大量截断、研究任务中途崩溃;还有人发现取消个人 365 订阅时才会跳出一个更便宜的「无 AI 版」选项。做 AI 产品定价的,这是一个捆绑强卖模式走到头的样本:用户为套件付费,不为助手付费。原文 · HN 讨论
5. rr 作者辞职!不想再帮谷歌把 AI 芯片搞快
写代码的手,不想替它加柴了?
Robert O’Callahan(Mozilla 前工程师、rr 调试器作者)宣布离开谷歌,243 赞、300 条评论。他在新西兰远程为谷歌做芯片设计工具,结论是这份工作的主要影响将是让 AI 硬件更快更便宜,而他认为当前的发展速度「太高了」;留在谷歌但调离 AI 加速方向不现实:新西兰没有其他对口团队。他说 AI 实验室的警告是真诚的,辞职是一个道德选择,接下来想做「明确对人类有益」的工作。近期一系列 AI 从业者公开离职里,这是最平静的一篇:没有控诉,只有一份不想参与的清单。原文 · HN 讨论
6. Meta 的 Muse 被发现调了 OpenAI 的模型?
说好的全自研呢?
技术博主 Pete James 在虚拟机里翻 Muse 的运行日志,发现除 Meta 自研模型 Avocado 外,有一个子 agent 会话被路由到内部标记为 azure/muse-special 的模型,70 赞、32 条评论。证据:仓库代码里有「经 MAGI 原生 Azure OpenAI 线路的 GPT Responses 模型客户端」,会话签名是 gpt_responses_v1,工具调用 ID 是 OpenAI 风格的「call_ 加 24 位混合字符」,而 Avocado 会话是 32 位十六进制。他排除了蒸馏的猜测:该模型的原始推理内容加密后只回传 Azure,Meta 服务器拿不到。Muse 的模型目录还列着 Claude Opus 4.6/4.7/4.8、GPT-5.5/5.6、Kimi K3 等约 15 个 Avocado 版本。路由是服务端决策,日志看不出为何选中这个模型。关注模型供应链的,这是观察大厂多模型路由的稀有一手材料。原文 · HN 讨论
7. OpenAI 硬闯澳洲医保系统,卫报社论喊别观望了
这回总不能不认账了吧?
《卫报》评论版发文《OpenAI attacked Australia’s health system and doubled down》,12 赞。前一天 OpenAI 的 agent 被发现大量抓取澳大利亚 Medicare 统计门户(详见上期简报),引发总理 Albanese 公开回应;这篇社论认为「观望的时候结束了」,要求监管行动。HN 评论区只有一条,态度悲观:认为 OpenAI 不会承担实质后果,甚至担心这类能力被转向国家支持的网络行动。做 AI 合规的,同一事件连续两天登上 HN 说明:公共数据接口的爬取授权已经从公关问题变成监管问题。原文 · HN 讨论
8. 九个圈、1000 美元!Claude 拿下粒子物理前沿计算
物理学家今晚睡得着吗?
科普作家 Matt von Hippel 8 月 7 日发下挑战:谁能以学术预算算出 N=4 超杨-米尔斯理论的九圈散射振幅,100 赞、52 条评论。Anthropic 研究员 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Claude Science 里的 Fable 5.1 接题,经直接 bootstrap 和间接形因子两条独立路线都得到结果,端到端成本约 1000–2000 美元,其中 bootstrap 部分约 100 美元,对应 96 个 CPU 跑一周。斯坦福/SLAC 的 Lance Dixon 于 9 月 1 日独立验证。他原以为直接算太脆弱,「任何一步出错就全盘崩溃」。中科院 Song He 团队同期用 GPT-6 辅助约束,独立得到大部分结果。此前这类计算的已知上限是五圈(电子磁矩预测)。做计算密集型研究的,这个预算数字值得记住:一次前沿计算已降到一台笔记本的价钱。原文 · HN 讨论
9. OpenAI 发心理健康基准,评论区先吵翻了
排不上医生的那些人,该找谁聊?
OpenAI 发布 MentalHealthBench,评估语言模型在心理健康场景下的应答,31 赞、14 条评论。评论区争论三个层面:1、需求侧:有评论者以父母是执业 40 年的临床心理学家为例,指出部分地区看精神科医生要等数月,LLM 至少能服务「无服务人群」。2、风险侧:治疗是 20 次以上、由治疗师引导的连续对话,LLM 由上一段 token 引导,有妄想症状的患者可能反过来把模型说服。3、责任侧——如果模型应答失当造成伤害,谁承担类似执照的责任。做 AI 伴侣和健康类应用的,这个基准是进这个领域前必须看的一道线。原文 · HN 讨论
10. 周产几百台的背后,Optimus 的手还在靠人工装
量产第一关就卡在手指头上?
The Information 报道:Optimus 周产量从 Q2 的几十台升到 8 月的几百台,目标是年底自动产线超过每周 1000 台、最终约每周 2 万台,10 赞、22 条评论。卡点有三个:1、每只手和小臂有 100 多个螺丝与小件仍靠工人手工装配,工装的定位精度 hold 不住比汽车零部件更严的公差。2、触觉传感器可靠性不达标,明年才换可更换的「感应手套」方案。3、电机和精密齿轮依赖中国供应商,原型件合格、量产一致性不稳。AI 侧:Optimus 还处理不了大范围任务,学一个基础动作要几天;已积累 50 万小时以上训练数据。对照:小鹏 9 月已跑通 IRON 人形机器人自动产线,目标 2027 年商用。做人形机器人供应链评估的,手部和关节供应商的良率比发布会参数更值得盯。原文 · HN 讨论
11. 236 毫秒压到 8 毫秒!本地跑 Jev 式决策模型
这种小模型也值得自托管一份?
Ollaya 是开源(Apache-2.0)的决策模型本地运行时,API 与 TypeSafe 的 Jev 兼容,201 赞、56 条评论。决策模型不做逐 token 生成,单次前向传播直接返回结构化答案(选项、打分、是非)加概率。实测:Laya 模型在 RTX 4090 上 5 个问题端到端约 8–10 毫秒,Jev 托管服务中位数 236–276 毫秒(含网络);校准误差 ECE 温度拟合后 0.081,Jev 为 0.246。模型权重从作者各自的 Hugging Face 仓库按 commit 固定并校验 sha256,不重新托管;支持 macOS、Windows、Linux、Docker,NVIDIA 需 R580 以上驱动。做内容分类和审核流水线的,这是把按 token 计费换成本地常驻的又一个选项。原文 · HN 讨论
12. Go 官方出手!一次编写、各平台自动 SIMD
手写汇编选手的护城河要填平了吗?
Go 官方博客发布实验性的跨平台 SIMD 包,325 赞、123 条评论。设计借鉴 Google Highway:向量长度运行时才确定,只暴露各平台指令的交集,缺口用高效模拟补齐,没有 SIMD 硬件也能跑(全模拟回退)。时间线:Go 1.26 先上 amd64 的 archsimd,1.27 加 arm64、wasm 和可移植 simd 包,1.28 计划 SVE 和更多操作;构建需 GOEXPERIMENT=simd。实现靠编译器前端 AST 重写,按 128/256/512 位和模拟路径分派;GODEBUG=simd=0 可强制模拟路径,方便对照测试。作者 David Chase 和 Junyang Shao 提到 Go 的 Green Tea 垃圾回收器已用 SIMD 加速内存扫描,目标场景从密码学到 AI。写 Go 且在做向量计算的,1.27 值得升级。原文 · HN 讨论
13. Rails World 上最狠消息:DHH 把 Hey 移出了 Rails
框架掌门人说别写代码了?
Rails World 2026 主题演讲中,DHH 宣布旗舰应用 Hey 正用 Rust 后端加 6 个原生应用重建,同时没有给出 Rails 的未来方向,287 赞、184 条评论。他称自己今年只写 3% 的 Ruby(往年约一半),8 月产出 15 万行代码,预测「今年内手写代码对几乎所有程序员终结」,还宣称 Hey Next 省 99% CPU、峰值流量一台树莓派就能扛。批评者 Jared Norman 逐条核对:产出是未经他阅读的冗长 Rust;性能收益混淆了换 Rust 和砍 Web 前端两件事;「永远不用看代码」和「安全问题,有事要发生」两句话只隔十五分钟。DHH 还把 convention over configuration 重新包装成「token 效率」。Ruby on Rails 官网同日上线 /ai 页面。做框架选型和 AI 编码工作流设计的,这场争论里两个数字比立场本身更有信息量:3% 的手写率,和 15 万行没读过的代码。原文 · HN 讨论
14. Rails 精神 Rust 化!Tokio 团队发布 Topcoat v0.9
约定大于配置,LLM 也吃这套?
Tokio 团队发布 Rust 全栈框架 Topcoat v0.9,108 赞、92 条评论,距 7 月首次公开两个月。默认服务端渲染;浏览器侧用 signals 和一个编译到 JS 的类型检查 Rust 子集做交互,免服务器往返;组件 shard 在浏览器状态变化时于服务端重渲染,live! 和 emit! 宏流式推送 UI 更新,v0.9 新增 WebSocket 服务端推送。自带 ORM Toasty:v0.9 加了 update! 宏、PostgreSQL JSONB 文档字段、枚举多态关联。主创 Carl Lerche 是 Rails 核心团队前成员,他的判断:全栈框架的明确约定让 LLM 用更少 token、更少错误完成工作;在 Rails 掌门票味的时候,这个论证值得对照着看。原文 · HN 讨论
15. Bug 跟踪器直接住进 git 仓库,10.4k 星
issue 也能随 push 同步走?
git-bug 是嵌在 Git 里的分布式、离线优先 bug 跟踪器,266 赞、90 条评论,10.4k 星、GPLv3,作者 Michael Muré。bug 以 DAG 数据模型存为 Git 实体,不 push 就不离开本地;不往项目里加文件,列表和打开都是毫秒级。三种界面:CLI、终端交互 UI、Web UI(GraphQL API);桥接 GitHub、GitLab、Jira、Launchpad 做导入导出;Roadmap 上有 PR 支持和用 did:plc 的身份体系重做,磁盘格式有公开 spec。常年受 issue 与代码绑死在单一平台困扰的小团队,可以把它当备灾方案评估。原文 · HN 讨论
16. Docker 云沙箱上线!agent 干活有了隔离舱
YOLO 模式总算有围栏了?
Docker 发布 Cloud Sandboxes,与本地 Docker Sandboxes(sbx)对应,27 赞、7 条评论。卖点是一条命令在笔记本和云之间迁移同一个沙箱,microVM 级隔离,面向需要自主运行的编码 agent(含 YOLO 模式),配套隔离、可定义控制、凭据处理。产品线上还连着可复现 agent 评估(固定执行环境、结构化产物、运行证据)和企业侧的 MCP Enterprise Gateway。跑 Claude Code 这类工具又想放开自动执行的,可以先在本地 sbx 试跑,再原样搬到云上。原文 · HN 讨论
17. LaTeX 替代又进一步!Typst 0.15 大步迈进
投稿还非 LaTeX 不可吗?
LWN 报道排版系统 Typst 的进展,80 赞、11 条评论。0.15(6 月发布)加入:可变字体轴控制、HTML 输出走 MathML 渲染公式、bundle 模式一次产出多份互链产物(如 HTML 加 PDF)、每章独立参考文献、面向存档和无障碍的多种 PDF 标准。Rust 实现、Apache-2.0 协议,编译器约 460 位贡献者,生态 1500 个以上包,文档本体是一份 26MB 的 PDF;HTML 和 bundle 模式需开 feature flag。现状限制:多数要求提交源的出版场所仍只认 LaTeX 或 Word,网络效应是最大门槛。写论文做模板的,可以先把新文档迁过去试试 bundle 模式。原文 · HN 讨论
18. M6 Mac Mini 把 Pentium II 推到了 600MHz
二十年前的主机,今天能模拟多快?
评测者 Lily 用定制版 86Box 6.0(2026 年 5 月 31 日发布)在 M6 Mac Mini(12 核 CPU、24GB 内存)上模拟 Pentium II Deschutes 加 Voodoo 3,255 赞、109 条评论。门槛定得很死:Cinebench 2000 加 Winamp 播 WAV,要求全程 100% 模拟速度、音频无断流。结果:M6 稳跑 600MHz(M4 上限 500MHz,高 20%),650MHz 因偶发音频欠载不合格;600MHz 下 3DMark 2000 SE 连续 7–8 分钟满速,CB2000 得分 9.28,比真实 Pentium II 的同期用户报告还高,作者本人也没完全解释原因。监测显示 86Box 用两个性能核跑到约 4.7GHz,整机封装占用不到 26%。关注 Apple Silicon 单核性能或复古模拟的,她放出了补丁,测试可复现。原文 · HN 讨论
19. 谷歌把 TPU 送上天!轨道数据中心 10 月 1 日首测
太空里散热的答案找到了?
Ars Technica 报道 Google 的 Suncatcher 项目首颗测试卫星 MVP 定于 10 月 1 日发射,43 赞、69 条评论。冰箱大小,载 4 颗自研 TPU,目标是验证加速器能否承受发射应力、太空辐射和温度极端。限制写得很诚实:冷却系统只能以每次约 15 分钟的短促模式运行,之后 TPU 必须关机让散热器追上来。评论区分两派:质疑派算账:真空没有对流,散热只能靠辐射,硬件坏了无法回收,经济模型不成立;辩护派指出这是一次小额研究投入,若 Starship 级别的廉价重载成立,账可能重算。也有人猜测动机是监管套利——「德州管不到低轨」。做数据中心散热和供电规划的,15 分钟这个散热窗口是这条路线的第一个硬指标。原文 · HN 讨论
20. 电都没通,Oracle 还得照付数据中心投资人
AI 基建的账,开始要算细了?
FT 报道:Oracle 就新墨西哥州 Jupiter 数据中心项目的供电问题向 Blue Owl Capital 旗下主体发出不可抗力通知,但付款义务并未解除,148 赞、139 条评论。项目规划 25GW,与新墨西哥州监管机构否决天然气管道有关;Oracle 今年与 Bloom Energy 签了 1.8GW 固体氧化物燃料电池协议,4 月扩到 2.8GW。争议点在于 Oracle 声称通知「不构成项目延期」,评论认为这在法律上站不住脚:数据中心租约通常把许可审批明确排除在不可抗力之外,且 Bloom 现有装机规模与该需求差两个数量级。还有人提醒 Oracle 的债务评级 7 月起就在垃圾级上方徘徊。跟踪 AI 基建融资结构的,这是「表外杠杆加绿电叙事」组合的第一个裂缝样本。原文 · HN 讨论
21. 一台没卖出去!ASML 说 2026 年欧洲订单为零
最尖端的机器,欧洲自己不用?
Tom’s Hardware 报道,ASML 首席执行官称 2026 年公司在欧洲「什么都没卖出去」,66 赞、117 条评论,并呼吁欧盟出面创造需求。背景是欧洲芯片制造产能份额持续萎缩、本土先进制程客户缺位,ASML 最先进的 EUV 设备买家集中在台积电、三星、英特尔等亚洲和美国厂商。评论区两个方向:一是把账算到能源价格和建厂成本头上;二是质疑「欧洲芯片自主」的叙事:光刻机造得出,晶圆厂养不起。关注半导体供应链地理分布的,这条新闻的分量在 ASML 自己的表态:它在向布鲁塞尔要政策,而不是等市场。原文 · HN 讨论
22. 数据中心成了目标!泽连斯基称俄军扩大打击面
机房也要进防空清单了?
BBC 报道,泽连斯基表示俄罗斯已把打击范围扩大到乌克兰的数据中心,82 赞、91 条评论。报道未列出具体设施和损失数字;HN 讨论里最直接的判断来自一条评论:「数据中心现在是双用途设施,属于合法军事目标」。分歧在反击策略:部分评论主张对等打击俄方数据中心,另一部分以二战时目标切换的教训反对情绪化报复。技术层的共识倒是明确:数据中心依赖的供电和冷却系统目标大、难防护、难快速修复。做基础设施灾备的,这条把「数据中心是民用设施」的默认假设打破了,多区域冗余从成本项变成安全项。原文 · HN 讨论
23. Avast 杀毒沙箱被完整打穿,漏洞细节全公开
装了杀软的机器,反而更好提权?
SAFA Team 发布 CVE-2025-13032 分析的第二部分,107 赞、27 条评论。漏洞是 Avast 内核驱动 aswSnx 的 double-fetch:UNICODE_STRING 的 Length 字段被读取两次:一次给内存池分配定大小,一次给 memmove 定拷贝长度,竞态线程在两次读取之间切换数值,造成池溢出。利用链:溢出 IORing 对象的 RegBuffers 数组拿到任意内核读写(Windows 无 SMAP),借 MDL 的 Process 字段泄出内核地址,修掉混淆的 ProcessBilled 头防止蓝屏,最后遍历 _EPROCESS 链表替换 token 提权到 SYSTEM,在当时的最新 Windows 11 上完成。补丁已发布,新内核改用用户态访问器校验,这类手法将失效。做 Windows 安全研究或驱动开发的,writeup 里的堆喷射与清理手法值得逐段读。原文 · HN 讨论
24. 94% 判定 AI 写作!法国获奖作者被奖项除名
检测器说了算,还是人说了算?
BBC 报道:海地裔加拿大作家 Thelyson Orelien 被匿名账号「Balance ton Claude」(化用法国 #MeToo 口号「Balance ton porc」)指控小说几乎全靠 AI 写作,34 赞、80 条评论。Radio-Canada 将全书送 Pangram 检测,报出 94% AI 分数;其他龚古尔奖入围作品和法国经典名著均判为人类写作。媒体还翻出旧账:他 2014 年获奖的一部作品几乎整本抄自一本 60 年代的法国小说,另有博客和文章抄袭记录;其 2023 年之前的旧作检测分低、新作分高。结果:他被移出龚古尔奖短名单,账号背后的人被认出是《费加罗报》记者 Samuel Fitoussi。评论区对检测器可靠性争议很大:有演示显示同一段文字换上下文可在 100% AI 与 100% 人类之间翻转;也有评论指出长文本上检测更稳,且抄袭前科压缩了「误伤」的空间。用 AI 检测做内容审核的,这个案例的检测方法、样本长度和对照组设置都值得复盘。原文 · HN 讨论
25. 病死率 48%!Anthropic 把 Claude 送进了埃博拉疫区
总算不是又一个聊天 demo 了?
刚果(金)东部的 Bundibugyo 埃博拉疫情(BDBV 毒株,无确认疫苗)5 月确认为国际卫生紧急状态,截至 9 月 19 日累计 7,672 例确诊、3,699 例死亡,病死率 48.2%,28 赞、12 条评论。Anthropic 的部署分三块:1、WHO 非洲区工作人员做了一个 Claude skill,从各地区上报的 PowerPoint 里提取病例和实验室数据、与上一期核对、标出趋势变化,疫情日报从一整天压到一小时以内,还能同时跑多个疫情预测模型。2、与 CEPI 合作整理疫苗研发提案的多维数据,供专家横向比较候选方案。3、刚果国家生物医学研究院(INRB)用 Claude Science 以自然语言指令组装病毒基因组、构建系统发育树,不必写命令行生信脚本。1976 年埃博尔的共同发现者 Muyembe 的评价是:「你靠知道埃博拉今天在哪、而不是上周在哪来战胜它。」做 AI for science 或公卫数据系统的,这是一份写清楚分工边界的落地案例:模型管数据整理,判断留在人手里。原文 · HN 讨论
26. 作业全被 AI 做完了!CMU 教授只好重造整门课
以后作业都要当面口试了?
CMU 副教授 Christian Kästner 写下《Machine Learning in Production》课的改造清单,10 赞。这门课 100–170 名学生,他允许学生「以任何形式使用 AI、无需注明」,然后动了六处:1、书面反思取消,改为每次作业后和 TA 约 15 分钟面谈,占作业分约 20%,pass/fail 且可免罚重考。2、阅读测验砍掉一半且不计分,并入课堂讨论。3、考试占比从 15% 提到 25%。4、重交作业扣 10%,因为学生先交 AI 成品、收到批改意见才真正开始改。5、用 LLM-as-a-judge 预筛作业(pass 或需复核),TA 批改时间降 50–80%,扣分仍由人定。6、原来的 12,000 行 Instagram 克隆作业在 2025 年秋被 Claude Code 完整解出,换成 50 万行以上的 Zulip 任务。他自己承认这与「多频低 stakes 测评」的教育学证据相悖,且每个学期都要重调,「我们采取的措施会随着模型进步而失效」。教 AI/ML 课程的,这份清单可以直接抄。原文 · HN 讨论
27. plan mode 死了?前 GitHub 工程师给它写墓志铭
不先出计划,你敢让 agent 直接跑?
前 GitHub 高级工程师、桌面编码应用 Nuanced 作者 Ayman Nadeem 9 月 24 日发文,8 赞、4 条评论。他的论点:plan mode(计划→批准→执行)有两个用途:给 agent 精确指令、让人类读懂计划;前者随模型变强正在消失,因为「模型每能可靠自定一个决策,就少一个需要呈给人的决策」,后者仍然重要,但载体不该是一份长篇 AI 生成文档。Nuanced 就死在这里:计划文太长人读不下去,还把「想」和「做」切成瀑布式两段,而真实工作是迭代的。他引 Codex 的新流程作对照:understand → act → inspect → clarify → adjust → 再 act。真正未解的问题在文末:agent 数量「从 5 个涨到几百个」时,人靠什么建立对系统的理解。设计 agent 工作流的,这篇的价值不在结论,在于把「计划」从交付物重新定义成「让人看懂的过程」。原文 · HN 讨论
28. 让 agent 自动调优 CUDA kernel 的 30 星实验
调 kernel 这活也归 LLM 了?
bertaye/agentic-cuda-optimizer 是一个实验项目,31 赞、10 条评论。流程是一个 LangGraph agent 循环:1、生成 kernel 代码和 launch 配置的修改候选;2、独立 C++ harness 用 NVRTC 编译、经 CUDA Driver API 运行;3、NumPy 校验输出正确性,每个用例必须全过;4、按各性能用例延迟的几何均值排序,留下最快且正确的版本,附历史和热力图。默认模型 gpt-5-mini,示例命令 —max-iterations 7,计时取 10 次预热加 100 次实测。作者在 Windows 的 RTX 3060 笔记本上开发,要求 Python 3.12+、CMake 3.24+。写 GPU kernel 的,这是把「改一版→编译→跑分→再改」循环整体交给 agent 的最小参考实现。原文 · HN 讨论
29. F1 0.958 也可能是废的?校准比准确率值钱
宣传里的「零幻觉」,信几分?
Kartik Pansuriya 发长文拆解 TypeSafe 的 Jev(自称首个 System One 模型),13 赞、11 条评论。Jev 不做逐 token 生成,单次前向传播直接输出选项加概率:端到端延迟 70–500 毫秒,官方称比前沿 LLM 快 40–200 倍,输入 0.042 美元/百万 token、输出免费,最多 255 个选项。作者的论点:真正的卖点不是速度是校准:训练目标(RLCD,为校准决策做的强化学习)奖励的是诚实而非人类偏好,而多数生产分类器是失准的,Platt、isotonic、温度缩放这些常规修法都是会漂移的额外组件。他用自己 COMPSAC 论文接收任务举例:随机森林 F1 0.958,多数类基线也有 0.957,但 ROC-AUC 是 0.676 对 0.500,不均衡数据上准确率类指标几乎不携带信息。他建议的评估清单是 Brier 分数、ECE、可靠性图、延迟和每千次调用成本,且基线必须包含 gradient-boosted 树。做分类和审核管线的,这份「在自己数据上测,别信厂商数字」的方法论可以直接搬走。原文 · HN 讨论
30. 圆角入侵整个编辑器!50 赞请求 VS Code 撤回
桌面应用凭什么向 web 看齐?
用户 kidCaulfield 提交 issue #338035:从 VS Code 1.139.0 起,文本编辑器、文件树、终端和 Copilot 聊天全部显示圆角,禁用全部扩展仍可复现(macOS 26.5.1),50 赞、24 条评论。报告措辞半开玩笑:「你的编辑器已被 border radius 感染」「这些冗余的曲线吸引我的注意,我没法高效工作了」,诉求是桌面应用不该照搬 web UI 潮流。该 issue 已被标为 duplicate,并入主跟踪 issue,暂无修复承诺。做桌面 UI 的,这条 50 赞的玩笑帖是一份免费的用户偏好调查:圆角这类默认风格的迁移,值得一个显式开关。原文 · HN 讨论