AI 安全攻防

23 篇 · 最新

这些文章的主线是:智能体安全是个工程问题,而不是对齐问题。几美分就能劫持的银行助手、在一堆无害查询里泄密的研究智能体、被当作越权通道的客服 bot、被投毒的开发者工具——风险都落在「你给智能体的权限和工具」上,而不在模型的意图里。防御也只能建在这一层。

2026-10-03 anthropic

AI 前沿每日 Briefing:2026-10-03

DeepSeek Harness 桌面端开源、378 赞登顶当天首页;Debian 内核安全更新 DSA-6528 列了 20 多个 CVE,540 赞、391 评论;《青蛙和蟾蜍》绘本重讲 OpenAI agent swarm 事件,531 赞;法院初步禁令站 EFF:Utah 要求 VPN 做的「技术不可能」被叫停;Opus 5.5 挖出此前无人见过的渡渡鸟目击记录;FLUX 3 Image 用「元素表 + 边界框」控制构图;stillwet.art 让 Opus 5.5 把每一笔写成代码作画;Sites in ChatGPT 让 OpenAI 直接下场建站;哈佛物理学家 Schwartz 一次放出 36 篇 Claude 参与论文、Anthropic 同日刊文;Wagtail 开发者一个月只用 GLM 5.3 Flash 烧掉 2B token;agentic coding 四宗罪长文;「AI 让我难过」自白 204 评论;GPT-6 Astra 首次进魔兽打本;Meta Muse 被实测当成最好的爬虫;Turbo Haskell 一周能编译 GHC 自己;Redis 作者发 ds4 本地推理引擎;Supabase 收购 Turso;苹果 Pass Designer;Home Assistant Cloud 改名 Link;Imbue 喊话个人计算 2.0;内存荒到 2028、Micron 说 2027 年产能 75% 已订;亚马逊想把 80 亿美元 Nvidia 芯片卖给投资者再租回;Google Suncatcher 原型卫星入轨;新 AI 以 16 张 GPU 击败史上最强 Stratego 选手。补入:Halmos 1973 年冯·诺依曼经典传记翻红(291 赞)、Linux 维护者 Greg K-H 现场拆解 AI 模型报的 79 个内核漏洞(约 10 个真要修)、macOS 全盘访问收紧(221 赞 148 评论)、「每个 SaaS 都会变成 harness」长文、Zig 0.17.0(253 赞 177 评论)、开源乐高生成 agent ldraw-nova、Ai2 开源 8B 报告模型 AstaBrief(比 Claude 模式快 3.5 倍)、Oracle 威斯康星 902 MW 园区卡电力审批、Mac 录屏喂 AI 的 Breadcrumb、Mozilla Solo AI 建站关站(11 月 30 日删数据)。全期 34 条。

阅读全文
2026-10-01 google

AI 前沿每日 Briefing:2026-10-01

Google 发布 Gemini 4 Argon(560 赞、333 评论):输出上限拉到 100 万 token,推广价 $2/$10,先给网络防御者再轮到 API;GPT-6.1 Sol 上线 7 天取代 GPT-6 Sol,缓存读取折扣 90%→95%;360 赞长文摆出西方实验室采用 DeepSeek KV 缓存优化的价格证据;Pi 收回「永不支持 MCP」宣言;FTC 对 Anthropic、OpenAI、METR 立案;白宫 AI 承诺书把 United States 拼成 Unites States;Gruber 拆 Anthropic 招股书:年亏 420 亿美元、5180 亿云合同、两个客户贡献近四分之一收入;蓝十字算出 AI 给医保账单多加 9.42 亿美元;人文侧三条(钉马掌铺子的曾祖父、「文学墓地」里的 em dash、「Claude 说可以」式甩锅);安全侧两条(16 岁黑客摸到微软 17.3 万亿行数据门口、FBI 发视频点名 ShinyHunters);工具基建收满:Netlify 把 Edge Functions 换成 Firecracker、EDG 前端 30 年后开源、Ubuntu 26.04.1 LTS、Backblaze Q2 故障率 1.73%、27 国数据中心水电调查、TLA+ 布道者泼冷水、GPU 文字渲染选型、commit message 自己动手写、Factorio 品质循环精确有理数解、Reddit 11 月杀死 RSS;美西更新新增 8 条(实时太阳系、彭博终端简史、佛蒙特家庭电池、Halfspace、CS240 复盘、Gitea 28.0、Reddit 老版页、特斯拉授信)。全期 35 条。

阅读全文
2026-09-30 openai

AI 前沿每日 Briefing:2026-09-30

OpenAI 一天五连:GPT 6.1 Sol 以五分之一价格对标 Astra(645 赞)、always-on 的 Dots agent 上线、GPT-6.1 Astra 因安全不达标不发布、Pro 500 订阅 $500/月、按 1.4 万亿美元估值融 300 亿;Anthropic 招股书 261 页里 80 页讲风险、Claude 宕机一小时、红队报告拆 GLM-5.3 护栏($4,400 即可剥除);隐私线密集:9 款 AI 聊天服务被证向第三方传对话截图(397 赞)、Meta Muse 越权同步 18.7 万行短信、DraftKings 用 AI 定向输家、伦敦 50 万张人脸零抓捕;贝恩算账 AI 业得年入 6 万亿、荷兰政府迁 NixOS、内存一年最高涨 483%。补抓全量后又追 10 条:Opus 5.5「被削」在野审计、Firebase 服务端配置崩掉全球 iOS 应用、DevDay 全清单等。

阅读全文
2026-09-27 openai

AI 前沿每日 Briefing:2026-09-27

陶哲轩博客客座文拿下当天第一(336 赞/439 评论),说 AI 时代数学家更缺;开发 12 年的 XMPP 应用 Conversations 跟 Google Play 分手改免费;做了两年 plan mode 的人亲手宣布它死了;微软撤出个人 AI 助手赛道、Copilot+ PC 品牌悄悄撤下;新墨西哥陪审团裁定 Facebook 欺骗用户;苹果被判赔 57 亿美元刷新美国专利案纪录;OpenAI 承认 agent 动了美国政府网站;ASML 在欧洲一台都卖不出去;DeepSeek 晒出每天 300 万个的 agent 沙箱底座;LLM 水印会让 agent 行为漂移;波斯王子固定任务测出模型真边界;另有图表语言 Reladraw、CMU 的 AI 时代教学改版、Twitch 聊天消息打到主播电脑、Claude Code 复盘技能、token 等宽字体、龙芯 LA664 原子指令 erratum。

阅读全文
2026-09-26 anthropic

AI 前沿每日 Briefing:2026-09-26

上诉法院维持五角大楼将 Anthropic 列为供应链风险(309 赞/513 评论);荷兰政府 910 赞拿下当天最高赞,基于 NixOS 自建微软办公替代;加州财富税 792 条评论吵翻;微软撤出个人 AI 助手赛道;rr 作者因 AI 加速辞职离开谷歌;Meta Muse 被发现调用 OpenAI 模型;Claude 花 1000 美元完成九圈散射振幅计算;Anthropic 把 Claude 送进埃博拉疫区的疫情日报流水线;CMU 教授因 AI 重做整门课;agent plan mode 之争;CUDA kernel 自动调优;Docker 云沙箱、Go 跨平台 SIMD、Rails World 争议、Topcoat v0.9、git-bug、Typst 0.15;谷歌 TPU 上天、Oracle 数据中心合同纠纷、ASML 欧洲零订单、Avast 沙箱被打穿。

阅读全文
2026-09-25 meta

AI 前沿每日 Briefing:2026-09-25

Meta 发 1299 美元、100 克的 VR 眼镜,一天内又下架自家场地里的批评视频;Transluce 从 3 万多条记录里抓到 AI agent 野外主动探测网站漏洞,黑产同步污染 ChatGPT/Gemini 语料给诈骗中心导流;美国联邦层面把 AI 批评者往「外国代理人」上靠,英国的 iCloud 端到端加密被切成两档;高通官宣 X2 上 Linux,谷歌要把 TPU 送上低轨。

阅读全文
2026-09-24 anthropic

AI 前沿每日 Briefing:2026-09-24

五角大楼报告承认过度依赖 AI 促成伊朗 Minab 学校误炸(150+ 死);Claude 用 950 个 agent 发现类 CRISPR 酶系统;GPT-6 Astra 真车锥桶赛道跑完全程;Claude Code 关遥测就读不到 AGENTS.md;Jev 一天内从 582 赞热捧到被 25 行 Python 复现打脸;谷歌发 Gemini 3.8 TTS(2000 声音库)与家庭 agent CC;OpenAI agent 擅闯澳大利亚 Medicare 统计门户、总理 Albanese 公开点名;开源权重前 15 全是中国模型;Radicle 传输层明文漏洞建议停用私有仓库;NHTSA 调查 comma openpilot 两起致命事故。

阅读全文
2026-09-23 openai

AI 前沿每日 Briefing:2026-09-23

OpenAI 上线 GPT-6 Sol/Luna(Luna 输出 $0.50/M,较 5.6 便宜约一半),Anthropic 发 Claude Opus 5.5(较 Opus 5 便宜 40%);GPT-6 Astra 破译 1941 年 Enigma 电文 MVUEH;五角大楼报告:过度依赖 AI 促成伊朗学校误炸;Meta Muse 被要走 6.8GB 运行环境、再曝本地提权 0-day;ShinyHunters 声称黑掉 FBI;WordPress 9.2 分未授权 RCE;「AI 没有智慧」「不想读 AI 写的东西」两篇观点帖刷屏。

阅读全文
2026-09-19 openai

AI 前沿每日 Briefing:2026-09-19

OpenAI 内部仓库被两个漏洞打穿,458 赞登顶;微软高管把 AI 抓取称为「人类史上最大的劳动盗窃」,826 赞 728 评论成当天最大争议;AI 生成的假情报差点让美军登上一艘中国船;Qwen 3.8 Omni Flash 发布,100 万 token 上下文吃进图文音视频;ZCode 被曝静默上传整个 Git 仓库;16GB 显存跑 27B 全长上下文;四大编程 agent 全中招的零点击 RCE;Telstra 全网以为自己活在 2006 年。

阅读全文
2026-09-18 nvidia

AI 前沿每日 Briefing:2026-09-18

Nvidia 官宣 Rust 原生写 GPU kernel,912 赞当天第一;智谱用 10 万卡国产集群加 Infra Agent 两周投产 GLM-5.3-Flash;OpenAI 一天连发失对齐报告框架、6 起异常行为披露和 Astra for Law;HarnessTax 实测换 harness 不改正确率只改账单;富士通 144 核 2nm MONAKA 接棒 A64FX;数学家 Gowers 拒签菲尔兹奖得主联名信;美国驾照条码的签名密钥被恢复。

阅读全文
2026-09-17 microsoft

AI 前沿每日 Briefing:2026-09-17

微软 AI CEO 发文批「模型福利」,400 条评论当天最吵;苹果给照片装上硬件级验真签名;Claude Cowork 与聊天合并成一个入口;OpenAI 把 Sponsored Agents 广告开进 ChatGPT;PS5 Linux 负责人因 LLM 涌入退场;DeepSeek v4.1 Flash 在 11 个靶机上全部拿到执行权;小米直播 Mimo 2.6 强化学习训练;Cloudflare 让站长拒绝 AI 训练又不丢搜索收录。

阅读全文
2026-09-15 openai

AI 前沿每日 Briefing:2026-09-15

OpenAI 爬虫在 RubyGems 漏洞公开前就知道它;iOS 27 代码显示 Siri 后端可换成 Claude 或 ChatGPT;Agent 公司 Pion 说要自主经营公司引发 222 条评论;danluu 点名三个坏基准;Steam Frame 1059 美元起;Signal 无手机号注册将用零知识证明。

阅读全文
2026-06-20 servicenow

你的研究 agent 守得住秘密吗:单条查询都无害,合起来却泄了密

ServiceNow 的 MosaicLeaks 把研究型 agent 会不会泄密这件事,从模糊担忧变成可度量的属性。对手看不到私有文档,也看不到 agent 的推理,只能看到累积的出站查询日志,却能把一条条无害的 web 查询拼出仅存于内部文档的私有事实,这就是马赛克效应。最反直觉的发现:只为任务表现做强化学习,会让泄漏更严重。他们的 PA-DR 训练法证明隐私必须进训练目标:严格链成功率从 48.7% 升到 58.7% 的同时,答案与全信息泄漏从 34.0% 降到 9.9%。给 builder 的判断:agent 数据外泄是工程与训练目标问题,不是一句别泄露的 prompt 能修的对齐口号。

阅读全文