AI&逆向知识热点日报 2026-09-09
AI&逆向知识热点日报 — 2026-09-09
聚焦 AI 在 JS 逆向、安卓逆向、验证码、防爬、风控和爬虫领域的应用
数据采集周期:2026-09-08 ~ 2026-09-09(本期主题词是”边界迁移”:验证码的防线从屏幕移向服务端,漏洞利用的门槛被 AI 从”数月”压到”一周”,爬虫成本从”看不见的噪音”变成可量化的账单)
本期导读
本期第一条主线,是上一期”计算机使用 agent”叙事的验证码版续集:GPT-6 Astra 通关了 Neal.fun 的《我不是机器人》全部 48 个关卡——这 48 关不是普通 CAPTCHA,而是从勾选框一路升级到”找 Waldo、画圆、平行停车、AI 认 AI、反向答题装蠢、节奏游戏卡 85% 准确率”的完整人机挑战。但正如中文科技媒体的深度拆解所言:Astra 证明的是”视觉+GUI 闭环能跨过认知题”,并不等于攻破现代反机器人系统——因为 reCAPTCHA/Turnstile 的防线早已迁移到浏览器信号、服务端风险评分与 token 一次性校验,甚至正在进入”Agent 密码学身份 + 细粒度授权”的新阶段。对做爬虫与风控的读者,这是一篇必须逐段读完的”防线迁移地图”。
本期第二条主线,是一个让”AI 降低漏洞利用门槛”从口号变成账单的实证:安全公司 Calif 宣布用 AI 辅助发现并武器化了微信 VoIP 栈的内存破坏漏洞,做出首个跨 iOS/Android 的零点击蠕虫 WeWorm——AI 找到漏洞并写出首个 RCE 约 2 天,完整蠕虫再花 1 周,而过去同等规模通常需要大团队数月。好消息是腾讯已在 7 月收到报告并于 8 月完成修复,无真实受影响用户;但这条新闻把”攻击能力民主化”摆上了台面。
本期第三条主线是爬虫经济的”服务器侧账单”:git.kernel.org(Linux 内核官方 Git 服务)运维者 Konstantin Ryabitsev 公开数据称——任何时刻都有 14 个 CPU 核在 5 个分布式节点上专门为爬虫渲染 commit HTML,其 CPU 消耗超过了所有合法访问(包括 git clone)的总和。这条经 Simon Willison 转发的帖子(9/7~9/8 发酵),正好为 9/15 Cloudflare 新政(剩 6 天)补上了”为什么防御方要动手”的底层证据。
本期三大主线:① 验证码防线的”认知→身份”迁移(Astra 48 关通关拆解);② AI 把零点击漏洞武器化压缩到一周(WeWorm);③ 爬虫成本的服务器侧实证(git.kernel.org 账单,Cloudflare 9/15 前夜)。另有:UC Berkeley 开源 CUA-Lite 统一 Computer Use 平台、camofox 破万星等工具雷达。
1️⃣ GPT-6 Astra 通关”我不是机器人”全部 48 关:人机验证的”认知题”防线告破,但现代反机器人早已把防线迁走——一张给爬虫/风控工程师的”防线迁移地图”(本期头条)
- 事件:9/7~9/8,OpenAI Labs 成员 Sharif Shameem 用 GPT-6 Astra 演示通关 Neal.fun 网页游戏 《I’m Not a Robot》(我不是机器人) 全部 48 关,拿到游戏末尾的 “Human Verification” 人类认证证书(X 演示视频 9/8 起被腾讯新闻、网易、Firstpost、ExplainX、AI科技评论等大量解读)。关键点不在”通关”本身,而在它揭示的验证码攻防结构:
- 这 48 关是什么:不是普通图片验证码,而是一套递进式人机挑战——从勾选”I’m not a robot”框起步,逐步升级到认停车标志、找 Waldo(大家来找茬)、画接近完美的圆、平行停车、拼图、打地鼠、第 37 关从真人照片里挑 AI 生成的脸(AI 抓 AI)、第 42 关反向规则”要主动答错几道简单题来证明你是人”(AI 要学装蠢)、第 47 关节奏游戏准确率卡 85%(社区公认劝退关)等;普通人类通关约需 30~60 分钟;
- Astra 怎么做(架构要点,与上期 Portal 通关同源):不是逐题 OCR,而是走 Computer Use 闭环——看屏幕截图→理解当前任务语义→点击/拖拽/键盘输入→观察页面状态变化→继续下一步;OpenAI 官方定位即强调 Computer Use,ScreenSpot-Pro(GUI 语义→坐标的 grounding 能力)92.7%、OSWorld 2.0(长程桌面操作)72.6%(对比上代 Sol 65.7%,单任务耗时从 ~75 分钟降到 ~40 分钟);1.05M token 长上下文支持跨长流程保留工作状态;
- 克制声明(重要):Sharif 的演示未公开完整 harness、未声明严格 pixel-only,因此 48/48 不能当作严谨的纯视觉基准;ExplainX 等评测机构也强调这不能直接推出”真实 CAPTCHA 已失效”——因为真实网站根本不只靠一道屏幕题。
- 值得关注的原因:⭐⭐⭐⭐⭐ ① 对做爬虫/采集的读者:这是”验证码攻防”认知的必修更新——过去”视觉 CAPTCHA 挡得住脚本”的假设正在失效:当 agent 能看屏幕、会操作 GUI、能维护状态、懂装蠢,继续把安全押在”一道认知题”上会越来越脆弱;如果你还在用滑块/点选/图形题作为主要防线,请把本期当成升级信号(而不是等被打穿再升级);② 对做风控的读者:看清防线到底迁去哪了——以 reCAPTCHA v3 为例,浏览器向 login/register 等 action 请求 token,后端拿 token 调接口换 0~1 的风险评分 score,再结合当前 action 决定放行/质询/拦截,不是靠一次可见图片题的二元结果;Turnstile 更把”前端测量”和”后端决策”拆开:浏览器跑轻量 JS challenge(计算挑战、空间证明、Web API 探测、浏览器差异、行为信号)后签发 token,网站后端必须再调 Siteverify 验证,token 有效期 300 秒且只能一次性兑换——所以”篡改前端 JS 伪造验证成功”没用,因为业务服务器拿不到可通过校验的有效 token,”截获他人 token”也会被 single-use 机制拦下;③ 对做 agent 工具的人:往下还有两层更难仿的防线——浏览器/网络层(Cloudflare Bot Management 的 JA3/JA4 TLS 握手指纹、JavaScript Detections 持续采集浏览器侧信号,看的是 agent 看不到的”运行环境+网络连接特征”)与身份层(Cloudflare Web Bot Auth 已上线:Agent 生成 Ed25519 密钥对请求做 HTTP Message Signatures 签名,服务器按公钥验证”请求确实来自持有私钥的那个 Agent”——视觉能力再强,也算不出别人私钥对应的合法签名;配合 created/expires 时间窗防重放);④ 对初级工程师的理解脚手架:把 CAPTCHA 的历史想成一条”防线退守链”——从”读扭曲文字”退到”看图答题”退到”浏览器环境探测”退到”服务端行为评分”,现在正退向”密码学身份 + 细粒度授权”;攻击方(视觉 AI)追的是最外层的认知题,防御方早已把价值转移到内层;现代 agent 跑在真实 Chrome 栈里会继承大量真实浏览器协议特征——所以只靠浏览器指纹区分”人/机器”也终将困难,服务器只能把更多证据放进时间序列与业务上下文里联合判断(这正是行为风控的用武之地);⑤ 实操提示:若你的业务仍重度依赖”可见图片挑战”,至少把”token 单次有效 + 服务端二次校验 + 短有效期”这三件事做进架构。
- 来源:X:Sharif Shameem 演示原帖(Astra 通关 48 关) | Neal.fun:I’m Not a Robot(48 关原游戏) | 腾讯新闻:刚刚,GPT-6 Astra”鲨死了”所有验证码?(9/8 中文深度) | Firstpost:Astra clears all 48 CAPTCHA levels(9/8) | ExplainX:MazeBench 7x Lead & CAPTCHA Gauntlet(9/8,含”为何不意味着真实 CAPTCHA 被攻破”) | 网易/云头条:48 关全过报道(9/8) | 中文深度解读《GUI 已难拦机器,防线转向身份与权限校验》(AI科技评论公众号,9/8,经检索全文可见)
2️⃣ Calif 发布 WeWorm:AI 辅助两天发现微信 VoIP 栈漏洞、一周做出首个跨 iOS/Android 零点击蠕虫——“AI 民主化高级漏洞利用”的首份完整时间账(本期次头条)
- 事件:9/8,安全研究机构 Calif(Calif Research,加州 Palo Alto) 公开发布 WeWorm——自称首个通过微信语音通话在 iOS 与 Android 间传播的零点击(zero-click)蠕虫(《纽约时报》同步报道;Quartz、Cyber Security News、IT之家等跟进;calif.io/research/weworm 官方页全文):
- 漏洞本质:微信 VoIP 协议栈的一处内存破坏(memory corruption)漏洞——攻击者只需给受害者拨打微信语音电话,在振铃期间即可远程代码执行并完全接管其微信账号(读/发消息、打电话、以受害者身份操作);受害者无需接听、无需任何交互,接听后也只听到无声、利用照样成功;拒接只能阻止当次尝试,攻击者可趁受害者睡觉反复拨打;前提是攻击者需在受害者好友列表,但一旦先攻陷一个好友即可借好友身份向你的其他好友扩散;
- 跨平台蠕虫演示:三台手机链条——攻击机 Pixel 10a(Android)拨打 iPhone 17e(iOS)→ 振铃期间接管其微信 → 用被控 iPhone 拨打另一台 Pixel 10a → 再次接管,完成 Android→iOS→Android 跨 OS 传播;与其他已报告的 Android/iOS 系统漏洞(如 OEMpocalypse 系列)链式组合可升级为整机控制;
- AI 的角色(最核心):Calif 称借助 AI(开源 + 商用模型组合,未点名具体型号),团队约 2 天发现漏洞并写出首个 RCE 利用,再用 1 周完成可传播蠕虫;CEO Thai Duong 对 NYT 表示”这种规模的蠕虫过去需要更大的团队花数月”,言下之意 AI 已经能完成漏洞利用开发的大部分工作,人类只负责’打什么目标、怎么安全测试’的判断;
- 修复与披露纪律(可借鉴):7 月发现并向腾讯报告 → 8 月腾讯发布 iOS/Android 双端更新 → 8/28 确认服务端已为所有用户缓解(无需用户操作)→ 9/8 才公开发布,技术细节继续保留、计划在后续安全会议上完整披露(披露前主动封禁期等细节也公开,体现双向配合);Calif 认为不应简单归咎 AI——漏洞本就存在,AI 让”好人”也能更快找到并修复,防守方应把 AI 纳入漏洞挖掘管线。
- 值得关注的原因:⭐⭐⭐⭐⭐ ① 对做安卓/iOS 逆向的读者:这是”AI 辅助移动漏洞研究”最完整的公开演示——注意其工作流与你的日常逆向高度同构:定位攻击面(VoIP/通话这类”非常规攻击面”)→ 逆向协议/状态机 → 找内存破坏点 → 写利用 → 跨进程/跨设备链式传播;区别只是”哪个环节由 AI 提速”;建议把”AI 协助的漏洞挖掘 SOP”(用 LLM 做反编译代码摘要、候选污点路径生成、利用原语推导)列入自己的技能树,防守方与攻击方正在同一套工具上赛跑;② 对做风控的读者:零点击+社交信任链=风控模型要重新设防——WeWorm 的传播不靠链接/附件,用户无法凭”不点陌生链接”自保;风控能做的在服务端:异常呼叫模式检测(Calif 团队 7/25-28 账号曾被微信自动安全机制封禁,恰证明这种检测存在且有效)、对”被控账号向好友批量呼叫”的行为基线告警、”好友信任”不能成为免检通道;③ 对初级工程师理解行业:把这条与 8 月底 Wiz 蜜罐、9/8 上期 Pachocki 长文连起来读——“AI 降低攻击门槛”已经从理论推演变成有精确时间戳的实证(2 天找洞 / 1 周造蠕虫 vs 过去数月),这也解释了为什么头部模型在网络安全能力上被定到 Critical 级却要限流发布;④ 对逆向新人的合规提醒:WeWorm 是安全机构在漏洞已修复后、为行业警示做的负责任披露(PoC 演示);个人做漏洞研究请遵守授权测试原则,勿对未授权目标复现——“技术中立不等于行为无责”。⚠️ 文中技术细节部分暂未公开,本文仅做行业认知参考。
- 来源:Calif 官方研究页:WeWorm(9/8 全文) | Quartz:Calif built an AI-powered WeChat worm WeWorm(9/8) | Cyber Security News:WeWorm First 0-Click Worm(9/8) | 微博/中文编译解读:更新微信啦(含完整披露时间线 7/24 提交→8/21 双端修复→8/28 服务端缓解,9/8) | IT之家:安全企业 Calif 披露 AI 开发首个微信零点击蠕虫,漏洞已修复(9/8,via AIHOT 索引) | 背景关联:Calif OEMpocalypse 系列(应用级访问→设备 root 链)
3️⃣ git.kernel.org 的”爬虫账单”:14 个 CPU 核 7×24 为爬虫渲染 commit 页面,超过全部合法流量总和——AI 爬虫经济账第一次有了”服务器侧”的硬数字(Cloudflare 9/15 前夜的底层证据)
- 事件:Linux 内核官方 Git 服务 git.kernel.org 运维者 Konstantin Ryabitsev 在 people.kernel.org 发表 《Creepy crawlies》(原帖 8/29;9/7 晚 Simon Willison 转载并引发 HN 热议,9/8 被 AIHOT 收录、多家中英文媒体跟进),给出几张”扎心账单”:
- CPU 账单:在 5 个地理分布式节点上,任何时刻都有约 14 个 CPU 核在专门为爬虫渲染 commit 的 HTML 页面;原话 TL;DR:”我们花在给爬虫渲染 commit 上的 CPU 周期,超过了其他所有合法访问(包括 git clone)的总和“;第三方进一步测算:总 90 核中约 14~16 核(约 20%)持续被爬虫渲染占用,且呈波浪式尖峰;
- 请求账单:git.kernel.org 每天收到约 600 万次针对任意 commit 的请求,约 2/3 在门口被挡掉,放行的 1/3 中,按 Ryabitsev 的宽松估算约 2% 才可能是真人;
- 为什么会这么贵(机制拆解):爬虫不去做廉价的
git clone(一次请求拿整个历史 packfile),而是逐个走 Web 界面:请求 commit 页、patch、plain 渲染、以及”任意两个 commit 之间的 diff”——linux.git 有约 148 万 commit、git.kernel.org 还托管约 922 个 fork,所以”任意两 commit diff”类端点构成近乎无界的 URL 空间,且每个 diff 都要现场读对象+算差异,几乎不会重复命中同一 URL → 缓存基本失效; - 防御升级史(每级都比上一级短命):按 UA 封禁 → 爬虫改发浏览器 UA;按 IP/网络封 → 流量搬进通过消费级 App 内置代理 SDK 租来的住宅/移动 IP;当前防御是 Anubis(SHA-256 部分碰撞工作量证明 challenge)——先解 PoW 再放行,不要求人类注册;
- Simon Willison 的”个人化担忧”:他直言自己为 Datasette(把数据库发布成海量可爬网页的工具)担心——任何”URL 空间远大于内容”的动态站点(forge、wiki、目录、档案、内网搜索)都是同类靶子。
- 值得关注的原因:⭐⭐⭐⭐ ① 对做爬虫的读者:这是”爬虫成本由谁承担”的行业分水岭信号——爬虫(尤其 AI 训练/检索类)的成本由被爬方承担(渲染 CPU、带宽、存储),收益归爬取方;当连 Linux 内核这种”免费开放基础设施”都开始公开叫苦并上 PoW,意味着整个开放 Web 正在走向”关闭/收费/加锁”的斜坡——login wall、更激进限速、Cloudflare 式 bot challenge、内容退到 API/paywall 后,都在本期这条新闻里找到预言依据;合规爬虫从业者应主动做”好爬虫”:识别 UA、尊重 robots.txt、限并发、缓存已见内容、优先 API/feed/批量导出而非扫 HTML(Ryabitsev 明说:想要全历史请 clone,那对双方都便宜)——做”最便宜的那条路”的爬虫,才是能活得久的爬虫;② 对站长/反爬工程师:把”爬虫成本”纳入容量规划第一优先级——先量化再治理:日志里分离 bot 流量与真人流量、对昂贵动态页做预渲染+强缓存(让爬虫命中变成一次文件读而非 CPU 渲染)、按行为而非仅 IP/UA 限速、对最高成本端点(diff/搜索/筛选/购物车)单独上防护、必要时上 PoW 或 bot 管理服务;别指望 robots.txt 被遵守——它只是君子协定;③ 对做 agent 工具的读者:你的 agent 浏览第三方网站时,技术上就是一个爬虫——把”礼貌爬取”(识别 UA、遵守 robots、限并发、缓存、优先结构化接口)写进 agent 的默认行为规范,既是道义也是存活策略(被风控封禁的 agent 没有产出);④ 衔接 Cloudflare 9/15 倒计时(剩 6 天):Cloudflare 9/15 起对”新接入域名+免费档+带广告页面”默认拦截混合用途(mixed-use,同时搜索+训练+agentic)AI 爬虫,并将 Pay Per Crawl 演进为 Pay Per Use——kernel.org 这份账单正是”为什么平台要动手”的底层证据;做采集/反爬的团队建议在 9/15 前按上期清单完成策略配置,并留意”允许 Search / 默认拦 Training+Agent / mixed-use 一刀切全拦”的三分类默认值对自家流量结构的影响。
- 来源:people.kernel.org 原文:《Creepy crawlies》Konstantin Ryabitsev(8/29) | Simon Willison 博客:Creepy crawlies(9/7 转发) | Hacker News 热帖(id=49491791) | muhammad-ahmed.com:AI Brief 9/8(含 90 核/14-16 核、600 万请求/日、2% 人类、Anubis PoW 细节) | Cyber Corsairs:AI Crawlers Now Cost More Than Real Users(解读) | ClaudeWave:git.kernel.org burns more CPU on scrapers than on clones
4️⃣ UC Berkeley 开源 CUA-Lite:把 Computer Use 智能体的”环境/数据/评测/训练”统一成一个 Docker 化平台——做浏览器 agent 与自动化评测的”基础设施减负包”
- 事件:9/8,UC Berkeley 团队发布开源平台 CUA-Lite(GitHub: cua-lite/cua-lite,80⭐;官网 cua-lite.github.io),目标直指 Computer Use Agent(CUA,能点击/输入/操作真实软件的模型)领域的基础设施碎片化——agent、环境、轨迹数据、评测/训练框架散落在互不兼容的仓库里,每个团队都得先重造一遍管道。核心设计三句话:”一个动作空间、一种数据 schema、一条命令“(one action space, one data schema, one command),横跨桌面/浏览器/移动三端:
- Lite.OSWorld:砍掉”虚拟机税”——原版 OSWorld 是业界标准桌面操作评测,但每个任务要起一个完整 QEMU/KVM 虚拟机,需要嵌套虚拟化(多数托管云/CI 不提供);CUA-Lite 在纯 Docker 容器里用 GNOME 桌面复现同一任务套件与评估器,无需 /dev/kvm:单实例内存 4.1GB→0.9GB、冷启动 29.9s→23.8s、同等硬件并行实例数约提升 4.6 倍;最关键的是保真度:团队称 13 个模型在容器里的得分与 OSWorld 虚拟机版一致(即容器里练出的信号可直接迁移到标准基准);
- 全家桶规模:约 30k+ 可验证任务(Lite.OSWorld / Lite.ScaleCUA / Lite.CUAGym / Lite.CUAWorld,后者覆盖约 40 个桌面应用含 Blender、QGIS、VS Code);15+ 基准(ScreenSpot-Pro、OSWorld 系列、WindowsAgentArena、WebArena、VisualWebArena、MiniWoB、AndroidWorld、MobileGym 等);10+ 内置 agent(GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B 等);20+ 数据集(Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey、Multimodal-Mind2Web 等预处理为统一 LiteSample schema:纯 parquet+图片,免费发布在 Hugging Face);
- 训练闭环:统一接口
scripts/rollout.py --model-id X --env-id Y一条命令换模型/换环境;每个模型家族有 adapter 做格式转换(含 history collapsing 多步共享一次前向);文档示例:用 Lite.ScaleCUA 桌面轨迹 SFT 微调 Qwen3-VL-2B-Instruct,mean episode return 从 0.138 提到 0.237(332 任务切分、单配置两卡,未独立复现,看趋势);RL 走”环境打分 rollout + GRPO(基于 Slime)”,MobileGym 示例覆盖 416 任务 × 28 应用。
- 值得关注的原因:⭐⭐⭐⭐ ① 对做浏览器 agent / Web 自动化的读者:这是”Computer Use 评测基建”正在标准化的信号——上期头条(Portal 通关)与本期头条(48 关验证码)都依赖”截图进、动作出”的闭环评测,而 CUA-Lite 把这套闭环的环境与数据层开源统一了;如果你在做 agent 化采集/自动化,可以借它的 LiteSample schema 与沙箱来低成本量化自家 agent 在 WebArena/OSWorld 上的表现,而不必自建 VM 集群;② 对做逆向/爬虫工具链的读者:注意它的”环境即数据”思路——把”操作轨迹”当作可训练/可评测的一等公民(screenshots up, actions down),与 js-reverse-mcp 等”让 LLM 操作浏览器做逆向”的工具同属一个生态方向;后续若有”用这类平台评测逆向 agent”的实践值得跟踪;③ 对初级工程师理解行业:CUA-Lite 的叙事是典型的**”基础设施成熟”信号**——当一个领域开始出现”统一环境+统一数据格式+一键评测”的平台,通常意味着该领域已过”手工搭台”期、进入”标准化复制”期;对想入局 Computer Use/浏览器 agent 的人,这类平台大幅降低了起步门槛;④ 注意风险点:仓库目前没有明确 license——商业使用前先确认授权条款;30k 任务/保真一致等数字多为团队自报,未被独立复现,落地前按上期”评测素养”的教训做交叉验证。
- 来源:GitHub:cua-lite/cua-lite(80⭐,9/4 活跃) | GitHub Pages:CUA-Lite 官网/交互式首页 | Saipien 解读:Container-First Platform for GUI-Driving Agents | Meta AI Labs:UC Berkeley Releases CUA-Lite(9/8) | InBlix:CUA-Lite Kills the VM Tax(含 4.1GB→0.9GB/4.6× 并行数字) | AINave:VM-free OSWorld in Docker(9/8)
5️⃣ 工具雷达:camofox-browser 破万星(9,448→10,298⭐),reverify 破千续涨,js-reverse-mcp/jshookmcp 稳爬——“隐身浏览器 + 确定性裁决 + 逆向 MCP”三线齐头并进
- 事件:GitHub 检索(9/8~9/9)+ 历史去重后,本期工具动态如下:
- jo-inc/camofox-browser(9,448→10,298⭐,9/6 更新,破万):C++ 级反指纹浏览器服务器(”bypass Cloudflare, bot detection”),一周涨约 850⭐,是本期增速最猛的工具——“agent 原生隐身浏览器”路线的社区认可度继续陡峭上行;配套 redf0x1/camofox-mcp(108→111⭐) 作为 MCP server 封装同步跟进(衔接 9/7~9/8 工具雷达);
- 2akouwu/reverify(1,003→1,034⭐,9/7 仍有提交):抗幻觉逆向 MCP——模型提议、确定性工具裁决(防”AI 编造分析结论”);续破千后的缓爬,方法论(LLM 建议 + 可执行验证闭环)与本期 Astra “动作后状态校验”、上期 Portal 通关”状态快照→执行→再快照”的设计同源,值得对照阅读;
- zhizhuodemao/js-reverse-mcp(2,698→2,708⭐)/ vmoranv/jshookmcp(1,976→1,977⭐):中文 JS 逆向 MCP 双雄稳爬;jshookmcp 9/8 仍活跃(jshookmcpextension 29⭐、Burp/ZAP 桥接插件等生态件继续长);
- BetterWright/betterwright(245→249⭐):持久化+策略守卫的 Playwright agent 浏览器,与 camofox 构成”轻量策略层 vs 底层隐身”两条互补路线;
- 2captcha/2captcha-mcp(19⭐)/ genpark bot-defense-detector-skill(8⭐):验证码服务商 MCP 化与”agent 事前感知 bot 防御”的生态观察件,星数低但代表”探测→路由→求解→回填”skill 流水线仍在成型(衔接 9/7~9/8 工具雷达);
- 面壁 MiniCPM5-2B 全家桶开源(9/8 持续发酵):在 9/7 发布模型基础上,连”配方”一起开源——数据:UltraData-Code(L0-L3 分级,算法代码约 400B+150B tokens)、UltraData-SFT-Agent-2609(约 50 万~100 万条 agent 轨迹,覆盖工具调用/网页搜索/CodeAgent/通用 Agent,跨环境采样)、UltraData-RL-2609(8 万+条,带三阶段清洗:可验证性过滤/奖励可信校验/难度匹配);框架:Meshy(去中心 RL 训练框架,去中央控制器与 Ray 依赖)+ JustRL II(给 GRPO 装 Critic 做词元级信用分配,专治端侧模型长思维链 RL 掉分);社区实测 16GB MacBook/RTX 3080 可本地跑(2B/128K 上下文)。
- 值得关注的原因:⭐⭐⭐ ① “AI 时代隐身浏览器”与”AI 时代可信逆向”正在成为两个确定性赛道:camofox 破万星说明”让 agent 长得像真人”是刚需(对应 Cloudflare 9/15 与风控升级带来的对抗需求);reverify 的”模型提议+工具裁决”则是逆向分析可信度焦虑的答案——两条线恰好映射本期两条头条的攻防两端(agent 隐身 vs 服务端身份化);② 端侧 2B + 全套 Agent 数据/RL 配方开源对逆向圈的实际意义:想本地离线跑”反混淆初筛/脱壳后代码解读/小模型辅助逆向”的团队,现在有现成的 agent 轨迹数据 + 训练框架可以微调私有小模型(数据合规自行把关),而 2B 级模型在 3080 级显卡即能推理——本地化、可私有化的辅助 agent 门槛又降一档;③ 小星工具照例仅供生态观察,动手前看 README 更新频率与合规声明;反指纹/反检测类工具仅限授权测试与合规用途。
- 来源:GitHub:jo-inc/camofox-browser(10,298⭐) | GitHub:2akouwu/reverify(1,034⭐) | GitHub:zhizhuodemao/js-reverse-mcp(2,708⭐) | GitHub:vmoranv/jshookmcp(1,977⭐) | GitHub:cua-lite/cua-lite(本期第 4 条,80⭐) | 搜狐:最强的 2B 小钢炮,将数据、框架带配方全部开源(9/8,含 UltraData 细节) | 网易:端侧模型开源 2B”小钢炮”,通用 Agent 杀到端侧(9/8) | Hugging Face:openbmb/UltraData-SFT-Agent-2609 | X:面壁智能 OpenBMB(Meshy/JustRL II 开源)
其他值得一瞥
- Meta 取消”以 AI 用量考核工程师”,内部刷量文化”tokenmaxxing”正式落幕(9/8):内部备忘录显示 AI 使用仪表盘与 token 计数不再计入绩效,改为按工作质量/速度/复杂度评估;此前员工为冲内部排行榜批量烧 token,2026 内部 AI 成本冲向数十亿美元;Meta 计划 2027 起改用”AI 使用预算+中央监控仪表盘”控成本,并正在内测自主处理电脑任务的 agent 工具 Hatch(员工因隐私顾虑不愿绑个人账号)。对做 AI 工程/风控的读者:这是”把 token 消耗当 KPI 会诱导刷量”的活教材——度量什么就得到什么(对指标的博弈)是风控与组织设计共同的第一课。⭐ 链接:TokenFeed:Meta drops AI usage from performance reviews | The Beat:Meta Quietly Retires Its AI Usage Scoreboard | 网易:烧钱烧到高管叫停(9/8 中文)
- Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元(9/8):三星电子领投,资金用于扩建训练与推理算力;Hugging Face CEO 公开祝贺。欧洲 AI”国家冠军”叙事升温,对关注开源权重/欧洲模型生态的读者可留意其后续开源策略(Anthropic 同日另有 5170 亿美元算力协议传闻,未证实)。⭐ 链接:TechCrunch:Mistral 完成 €3B D 轮 | The Decoder:Anthropic 5170 亿美元算力协议(9/7)
- 面壁智能祝贺 OpenMAIC 获联合国教科文组织认可;MiniCPM5-2B 在 16GB MacBook/RTX 3080 本地流畅运行获社区好评(9/8):端侧小模型的”可携带性”持续被验证——对需要离线、隐私、低成本辅助的逆向/分析场景是利好信号(本地跑 2B 做代码初读/日志分类已切实可行)。⭐ 链接:X:OpenBMB | X:面壁智能 MiniCPM5 本地运行实测
- 微信开源多模态嵌入模型 WeMM-Embedding,已在微信大规模使用、日调用量达 10 亿次(9/8):多模态 embedding 的开源阵营再添重量级玩家(文本/图像统一向量空间);对做向量检索、多模态 RAG、以及关心”embedding 开源化对语义搜索成本影响”的读者值得关注(嵌入安全议题可回溯 9/8 日报 vec2vec 头条)。⭐ 链接:IT之家:微信开源多模态嵌入模型 WeMM-Embedding(9/8,via AIHOT 索引)
- 52pojie 社区:[Web逆向] 基于 ChatGLM 的 web 逆向分析实例(9/7~9/8,社区风向):一篇用 ChatGLM 辅助做混淆 JS 逆向的实战帖(从断接口→定位混淆→在线反混淆→参数还原),代表”本地/轻量 LLM 辅助逆向”在中文社区的日常化——不追求 SOTA,主打”小模型也能当分析搭子”。⭐ 链接:52pojie:基于 ChatGLM 的 Web 逆向分析实例一则
上期(2026-09-08)条目追踪
| 上期条目 | 状态 | 本期进展 |
|---|---|---|
| GPT-6 Astra 自主通关《传送门》(3336 次调用/$571) | 能力续证 | 本期头条 Astra 再通关 48 关验证码游戏——Computer Use 从”游戏长程任务”扩展到”人机验证对抗”,且带出”认知题防线迁移”的深度拆解;两期连读可拼出完整的”计算机使用 agent 能力-成本-防御应对”图谱 |
| vec2vec:嵌入向量可无配对翻译(向量库≠保险箱) | 稳定 | 无重大新论文;本期”微信开源 WeMM-Embedding(日调用 10 亿)”提醒:embedding 开源化+大规模落地背景下,向量存储安全(上期 SHAQ 影子查询)议题仍值得持续跟踪 |
| Pachocki《An Alien Mind》(CoT 监控衰减/呼吁减速) | 稳定 | 无新增独立进展;其”可观察性支柱松动”论点被本期 Astra 48 关与 WeWorm 从攻防两端再次印证(推理越来越难读,防御下沉到行为/网络/身份层) |
| Ask HN:Fable 逆向钢琴卷专有编码(clean-room 版权) | 稳定 | 无新进展;版权/逆向边界议题继续低频发酵,做 AI 辅助逆向发布前仍建议走”事实/互操作信息 vs 复刻表达”的 checklist |
| Cloudflare 9/15 新政 | 倒计时推进(剩 6 天) | 本期第 3 条 kernel.org 账单为”平台为何动手”补上服务器侧证据;9/15 起新域名/免费档/广告页默认拦 Training+Agent、mixed-use 一刀切——站长与采集方建议本周完成策略配置与流量结构核查 |
| 工具雷达(Portal-agent/BetterWright/camofox-mcp/2captcha-mcp 等) | 星数更新 | camofox-browser 9,448→10,298⭐(破万)、camofox-mcp 108→111⭐、reverify 1,003→1,034⭐、js-reverse-mcp 2,698→2,708⭐、jshookmcp 1,976→1,977⭐、BetterWright 245→249⭐;新增 CUA-Lite(80⭐,本期第 4 条) |
| MiniCPM5-2B 开源(4B 以下榜首) | 全栈开源 | 本期补充:UltraData 数据集全家桶(Agent 轨迹约 50 万~100 万条)+ Meshy/JustRL II RL 框架同步开源——“模型+数据+框架+配方”齐活,端侧可复现性大幅提升 |
| 上期遗留待挖 | — | “AI 基础设施安全”(Wiz→WeWorm)与”评测可信度”(改分→benchmaxxing→tokenmaxxing)两条长线持续发酵;新增关注点:爬虫成本经济账(本期 kernel.org)预计将随 Cloudflare 9/15 落地继续升温,建议采集方把”礼貌爬取=存活策略”写入工程规范 |
数据来源:aihot.virxact.com 精选/全量流(9/8 Mistral 融资、WeWorm、Astra 48 关、CUA-Lite、MiniCPM5 全家桶、Meta tokenmaxxing 等多条索引)、多轮公开网络检索(Calif 官方 / Quartz / Cyber Security News / Firstpost / ExplainX / people.kernel.org / Simon Willison / Hacker News / TechCrunch / 腾讯新闻 / 网易 / 搜狐 / 52pojie 等)、GitHub API 交叉验证(star 数采集于 2026-09-09,UTC)。本日报面向技术学习与研究交流,涉及安全能力与绕过手段的信息仅作行业认知参考,请遵守相关法律法规,勿用于未授权目标。文中星标(⭐)为 GitHub star 数。











