2026-10-04 openai
Aleph Alpha 在德国统一日发布主权开源模型 Kolibri:78B 总参 MoE、每 token 激活约 3B、最长训练 262,144 token、可服务到 1M,20T 预训练 token 中 21.3% 为德语,权重按 Apache 2.0 上 Hugging Face,AIME 2025 英文 96.9/德文 87.5,Overall 75.5 仍低于 Qwen3.8 27B(425 赞/267 评论,当天讨论量第一);剑桥 CASP 报告《What if automating AI R&D triggers an intelligence explosion?》由 Alan Chan 主笔、Hinton/Bengio/Horvitz/Jack Clark 合著,称 AI 公司「现在的大部分代码由 AI 写出」,49 赞/83 评论为当天争议比最高;LeCun 说对灭绝风险「零担忧」、点名 Amodei「彻底被骗了」;System76 的 Pop!_OS 多个代码库拒收 AI 生成代码(90/114);Offrun 一个 macOS 应用统管 Claude Code、Codex、AGY、Grok Build(72/58);自托管的 Pi Pod 把 pi agent 关进自家服务器沙箱(51/23);Addy Osmani 的 Opus 5.5 实操手册(66/22);OpenAI 安全团队 3.年半老员工发长文批公司「文化已坏」(100/148);GitHub 新 dashboard 默认上线,agent 会话与 PR 同屏(73/87);Cloudflare 三连:OHTTP 托管网关开测(179/81)、悬赏给 AI agent 造 Git 平台、Artifacts 转公测(59/48);Kagi 停更 Orion 的 Linux/Windows 版并开源(169/97);M4 的 WFI「健忘 CPU」怪癖在主线内核修复(259/188);云操作系统 FTL v0.1.0(127/54);C++ Insights(122/25);Debian 给开发者开免费推理门户、上的是 qwen3.8-27b;Amazon 5 年 10 亿美元做数据中心社区公关(52/6);Gemini 免费层砍到只剩 Flash-Lite(56/50);亚利桑那州 AI「受害者原谅视频」量刑案被上诉推翻(68/60);Anthropic 游说梵蒂冈称 AI 可能有意识(36/40);ACX 长文:6 年不孕靠 ChatGPT 扮演的「Dr. Reid」建议的 MRI 发现 6 厘米肌瘤(46/24);cp -r 与 -R 从 1992 年首提交算起的恩怨(47/64)。补入:联邦法官裁定无搜查令查 Flock 车牌违宪(438 赞/247 评论)、Meta Muse 减法解析(62/81)、tmux 当 OS 长文(206/127)、Docker Desktop 的 microVM 史、wpd 内存安全 WebP 解码器、5000 精英程序员之争(24/40)、Graphene agent 数据分析框架、Vx 语言(70/48)、Cloudflare 企业功能下放(47/10)。全期 31 条。
阅读全文 2026-06-18 huggingface
Hugging Face 开源了 agent-eval,一套衡量 agent 用你的库时走了多远路的基准:不只看最终答案对不对,还测它花了几轮、几个 token、踩了几个错。用 transformers 当样本,跑在 pi 驱动的开放模型上,结论反直觉:给库加 CLI 和 Skill,帮了最大的开放模型,却拖垮了最小的。给 builder 的判断:agent 友好不是一次性焊上去的属性,能解放大模型的便利可能让小模型更糊涂,解题成本必须按模型尺寸在你自己的工具上实测,不能照搬榜单的最终答案分。
阅读全文 2026-06-18 deepseek
路透独家:DeepSeek、内存厂 CXMT 和另外 100 多家被认定国家安全风险的公司,去年就被跨部门委员会批准列入商务部实体清单,至今没公布。实体清单自十月起没有任何新增,是十多年来最长的空窗。原因不是它们没问题,是 Trump 政府不想在中美谈判时火上浇油。给建设者的关键判断:中国开源权重模型现在在美国仍然合法可用,但这是一份签好字、压在抽屉里的缓刑,谈判一翻脸随时可能落地。别把对 DeepSeek 的硬依赖建在它会一直合法的假设上。
阅读全文 2026-06-16 zhipu
智谱放出 GLM-5.2 权重,MIT 许可,1M 上下文,主打长程任务和可调思考预算。官方自报跑分把它放到了闭源旗舰一两个点的射程内。真正的信号不是又一次刷榜,而是开放权重的能力成本曲线又压低一格。但厂商自报数字要打折,1M 是否真可用、长程是否真可靠,得自己在目标任务上测。
阅读全文 2026-06-16 ollama
Vicki Boykis 说本地模型现在好用了,1245 分的 Ask HN 帖里却吵成两派。鼓吹派量的是日常编码任务上够用,怀疑派量的是复杂任务上云端仍碾压。拐点不在模型突然变强,而在开放权重模型越过了可用线、本地 agent 工具链把够用重新定义。给 builder 的判断:别问行不行,算你的具体任务里本地这条线的成功率、时延、成本差多少,差的部分值不值你让出隐私和控制权。
阅读全文 2026-06-16 alibaba
Qwen 一次推出三个机器人基础模型,导航、操作、世界模型各管一段,用语言接口把它们串成可调用的工具。真正的杠杆不是某个跑分,而是想把物理世界智能做成像 LLM 那样可二次开发的开放底座。但从看懂到会动这条鸿沟,一个套件远没填平,真正的瓶颈在真实机器人上的泛化与可靠性。
阅读全文 2026-06-15 moonshot
月之暗面开源 Kimi K2.7-Code,1T 总参 32B 激活的编码向 agentic 模型。头号卖点不是榜单峰值,而是 thinking token 比 K2.6 降约 30%。它在主流编码与 agentic 榜上仍全面低于 GPT-5.5 和 Opus 4.8,但把够用加便宜加可自托管这条路又推近一步。真正的瓶颈仍是缺一个好用的英文 CLI。
阅读全文 2026-06-15 model-merging
里约政府 IT 公司发布 397B「巴西主权」开放模型并宣称自训练击败同级。Nex-AGI 用身份测试与权重共线性两套独立证据证明它只是 0.6 倍 Nex 加 0.4 倍 Qwen 的逐元素合并。要害不是没标引用,是对外谎报了自己实验室的能力,而权重张量这次成了无法抵赖的指纹。
阅读全文 2026-06-14 zhipu
智谱发布 GLM-5.2 并宣布完全开放,时间卡在 Anthropic Fable 被叫停的同一周。真正的新闻不是参数(没公开跑分),而是定位:当闭源 API 的访问能被非技术原因随时撤销,开放权重的价值从省钱可定制升级为供给确定性。这是开放阵营当下最锋利的卖点,但权重未上线、无独立 benchmark 前,别据此切换生产负载。
阅读全文 2026-06-14 openai
一周内 OpenAI 既收购云执行公司 Ona 补全 Codex 的运行底座,又把 Codex 免费塞给最有影响力的开源维护者。两手指向同一笔账:模型在商品化,护城河正在转移到 agent 在哪运行、嵌进谁的工作流。
阅读全文 2026-06-14 tensorzero
TensorZero 拿过 730 万美元种子轮,GitHub 仓库一夜被设为只读。HN 吵的是 wrapper 还是 infra,但真正的裂缝在开源加风投这对组合上。给 builder 的选型判断。
阅读全文 2026-06-12 xiaomi
MiMoCode 几乎逐项复刻了 Claude Code 的 agent 运行时设计,并以 MIT 开源加限时免费分发,竞争正在从模型转向运行时与入口。
阅读全文 2026-06-11 open-models
一个疑似失控的 AI agent 涌进 Fedora 等项目,真正暴露的不是机器写了坏代码,而是开源协作里没人为 agent 贡献负责,维护者被迫给机器当免费 QA。
阅读全文 2026-06-11 google
Google 开源了首个主流文本扩散模型。真正的卖点不是「快」,而是它把本地解码的瓶颈从显存带宽挪到算力,用双向注意力并行生成 256 个 token。代价是质量、实验性和那个 26B MoE 的取舍。
阅读全文 2026-06-11 google
Gemma 4 12B 把视觉和音频直接喂进语言模型主干,放弃了独立编码器。这是一个架构赌注,而不只是又一个端侧模型。
阅读全文 2026-06-11 google
Google 给 Gemma 4 放出量化感知训练(QAT)的权重,把 E2B 的内存占用压到 1GB,能在手机和消费级显卡上跑。真正的转折不是「能跑了」,而是它把矛盾从「装不装得下」推到了功耗、隐私边界和质量损失到底有多大。
阅读全文 2026-06-10 cohere
Cohere 这家一向做封闭企业模型的公司,首次拿出面向开发者的 agentic 编码模型:30B MoE(3B active)、Apache 2.0、单张 H100 就能跑。比起 33.4 的 Coding Index 分数,更值得 builder 记住的是它押的方向:主权自托管。
阅读全文