AI 逆向知识热点日报 · 2026-07-14

关注 AI 在 JS 逆向、安卓逆向和爬虫领域的最新应用动态
数据来源:AIHOT (aihot.virxact.com) + WebSearch 多路并行检索 + GitHub 社区


1. JSIMPLIFIER:NDSS 2026 顶会论文,LLM + AST 实现 JS 反混淆新标杆

事件内容
奇安信星图实验室与北京邮电大学联合研究的 JavaScript 反混淆工具 JSIMPLIFIER 被 NDSS 2026(网络安全顶级会议)录用。论文题为《From Obfuscated to Obvious: A Comprehensive JavaScript Deobfuscation Tool for Security Analysis》。该工具创新性地将 四阶段流水线——代码预处理、AST 静态分析、动态执行追踪、LLM 智能变量重命名——整合为统一反混淆管线。研究团队系统归纳了 20 种 JS 混淆技术(词法级 5 种、语法级 6 种、语义级 7 种、多层混淆 2 种),并构建了迄今最大规模的真实世界混淆 JS 数据集(44,421 个样本,含 23,212 个恶意样本)。

核心数据:

指标 数值
混淆技术覆盖率 20/20 (100%)
处理成功率 100%
代码复杂度降低 88.2%
可读性提升 >4 倍(LLM 验证)
平均处理时间 83.17 秒/文件
LLM 重命名可靠性 88%
每样本 LLM 成本 $0.0104

工具已开源,支持 OpenAI GPT、Google Gemini 及纯 AST 模式(无需 AI),提供 CLI 和 Web UI 双界面。

值得关注的原因

  • 学术 + 工程双重价值:NDSS 是安全领域四大顶会之一,这是 JS 反混淆方向首次有工具实现 20 种混淆技术 100% 覆盖。LLM 在变量重命名环节的引入,解决了传统工具输出”晦涩难懂”的痛点——这正是 JS 逆向分析中最耗时的环节。
  • 直接可用于 JS 逆向:对爬虫/逆向工程师而言,遇到 OB 混淆、控制流平坦化、字符串数组加密等场景,可直接用 JSIMPLIFIER 一键还原,无需手动编写反混淆脚本。
  • AI 混淆也纳入研究范围:论文将”AI 辅助混淆”列为多层混淆的一种,预示未来攻防双方都将使用 AI——反混淆工具必须跟上。

来源链接


2. js-reverse-pro-mcp v2.1.0:JS 逆向 MCP 工具生态进入”Pro Fork”时代

事件内容
2026 年 6 月 17 日,开发者 a0yark 发布了 js-reverse-pro-mcp v2.1.0——基于 zhizhuodemao/js-reverse-mcp 的 Pro 增强分支,并选择性移植了 NoOne-hub/JSReverser-MCP 的核心能力。该版本标志着 JS 逆向 MCP 工具从”单一调试器”向”全链路逆向平台”演进。

Pro 版新增核心能力:

模块 功能 技术细节
Hook 框架 5 套内置模板(function/crypto/network/encoding/storage) CDP 注入 + Symbol-keyed sink,导航后仍存活
静态反混淆 deobfuscate_code Babel 快速模式:字符串数组内联、常量折叠、死分支消除、_0xabcd 重命名、方括号转点号;可选 webcrack 深度模式
代码收集 collect_code 自动扫描 sign/encrypt/hmac 等关键字 + AST 启发式排序
AI 辅助 understand_code / risk_panel 支持 OpenAI / Anthropic / Gemini,默认关闭,动态导入
会话快照 save/restore/dump/load_session_state AES-256-GCM 加密往返
任务产物 start_reverse_task 可共享的任务包 + 单文件可移植/重放

底层仍保留 Patchright 反检测引擎(C++ 级指纹修正、60+ stealth 启动参数),可在知乎、Google 等有 Bot 检测的站点正常工作。要求 Node.js v22+。

值得关注的原因

  • JS 逆向 MCP 生态快速分化:从原始 js-reverse-mcp(23 个工具)到 Pro Fork(hook + 反混淆 + AI + 会话管理),再到 JSReverser-MCP(90 commits,支持连接已开启 Chrome 复用登录态),工具链在半年内完成了从”能用”到”好用”的跨越。
  • Hook 框架是杀手级功能:5 套内置模板覆盖了 JS 逆向 90% 的 Hook 场景(加密函数、网络请求、编码转换、本地存储),且导航后仍存活——这意味着 AI Agent 可以在页面跳转后持续追踪加密逻辑,不再需要手动重新注入。
  • 反混淆与 AI 分析结合:deobfuscate_code 基于 Babel AST 做本地快速清理,再可选接入 LLM 做语义级理解——这种”本地 AST + 云端 AI”的分层策略兼顾了速度和深度。

来源链接


3. AutomatiQ:AI 看你浏览一次,自动逆向生成爬虫脚本

事件内容
2026 年 5 月 8 日,AutomatiQ v0.1.3 发布到 PyPI(MIT 许可证,GitHub 106+ stars)。这是一个全新的”逆向工程 AI Agent”——你只需正常浏览一次网站,它就会自动分析网络请求和操作行为,生成可独立运行的 Python 自动化/爬虫脚本。核心理念:“你浏览,AI 逆向工程,产出可直接运行的 Python 脚本”。

三步工作流:

  1. 录制(Record):通过 CDP 协议启动 Chrome,记录所有网络请求/响应体、Cookie 变化、用户交互(点击/输入/导航)、屏幕帧。按 Ctrl+C 结束。
  2. 编译(Compile):录制内容切分为逐操作视频片段,视觉 LLM(默认 Gemini 3 Flash)观看每个片段,分析”点击了什么、发生了什么变化、操作是否成功”。同时网络请求被解码、去重、结构化为”工作区 Dump”。
  3. 代理(Agent):LLM 驱动的”调查员”读取工作区 Dump,在隔离的 Python/IPython 沙箱中迭代实验,最终生成可独立运行的 Python 脚本。支持对实时站点测试假设,内置防循环和防重复保护。

技术特点:

  • 支持 Gemini / OpenAI / Anthropic / 本地 LLM(Ollama / LM Studio / vLLM)
  • 运行时无需浏览器依赖——最终产物是纯 Python requests 脚本
  • pip install automatiq 即用,Python 3.11+

值得关注的原因

  • 范式转变:传统爬虫开发是”分析页面 → 写选择器 → 调试 → 维护”,AutomatiQ 将其变为”操作一次 → AI 逆向 → 拿到脚本”。这对于 DOM 频繁变动的 React/Vue SPA 场景尤其有价值——不再需要维护脆弱的 CSS 选择器。
  • 视觉 LLM 的实际落地:AutomatiQ 是少数将视觉大模型用于”理解用户操作意图”的开源项目。此前的 AI 爬虫(Crawl4AI、Firecrawl)主要用 LLM 做内容提取,而 AutomatiQ 用视觉 LLM 做”操作语义理解”——这是更难但也更有价值的方向。
  • 逆向工程的 AI 化:从”人逆向 JS 加密逻辑”到”AI 逆向人的操作意图”——工具链正在从辅助人变为替代人完成机械性逆向工作。

来源链接


4. AI 驱动的安卓逆向全链路:Trae + Jadx MCP + IDA MCP + Frida MCP + Unidbg

事件内容
2025-2026 年间,安卓逆向社区(看雪、52pojie、CSDN、博客园)逐步形成了一套标准化的 AI 驱动安卓逆向流水线,其核心架构为”AI 扮演总工程师,指挥不同工具完成特定任务”。该工作流在 2026 年 7 月初被多篇技术博客系统化总结,标志着 AI 安卓逆向从”实验性尝试”进入”工程化实践”阶段。

五层架构:

阶段 工具 MCP 项目 作用
静态分析 (Java) Jadx zinja-coder/jadx-ai-mcp 分析调用链,定位关键 Java 函数,寻找 JNI 入口
静态分析 (Native) IDA Pro mrexodia/ida-pro-mcp(增强版 namename333/idapromcp_333) 分析 .so 文件,还原算法逻辑,识别加密/签名特征
动态验证 (Runtime) Frida dnakov/frida-mcp + zhizhuodemao/frida-mcp Hook Java/Native 层,获取运行时参数 (Key, IV, Data)
算法还原 (Emulation) Unidbg zhkl0228/unidbg 模拟执行 Native 函数,解决无法直接 Python 化的复杂逻辑
控制中枢 Trae / Cursor + Skills 自定义 Python 脚本 整合上述工具输出,生成最终可调用的 API 脚本

典型工作流(以豆瓣 APP _sig 参数逆向为例):

  1. AI 调用 adb-mcp 自动安装 APK → 检查设备 → 确认安装成功
  2. AI 调用 jadx-ai-mcp 反编译 APK → 搜索 _sig → 定位到 DoubanSignature 类
  3. AI 分析加密格式(HMAC-SHA1 + Base64)→ 生成 Frida Hook 脚本
  4. AI 调用 frida-mcp 注入 Hook → 获取运行时密钥和参数
  5. AI 编写 Python 加解密脚本 + mitmproxy 自动化请求重放脚本

社区实践亮点:

  • 看雪社区(2025-08-26):完整实战案例,自定义 adb-mcp + frida-mcp,AI 自动完成豆瓣签名逆向
  • 52pojie(2025-12-08):使用免费工具(通义灵码 + IDA Pro MCP + JEB MCP)构建零成本 AI 逆向工作流
  • idapromcp333 增强版:在原版 IDA Pro MCP 基础上增加函数/变量批量重命名、混淆检测、反调试识别、基础算法识别、爆破脚本自动生成

值得关注的原因

  • 标准化已成趋势:多个独立社区博主不约而同地总结了几乎相同的工具链组合,说明 AI 安卓逆向的工作流已经收敛——这不是实验性的玩具,而是可以落地的工程方案。
  • 免费方案可用:52pojie 的文章证明了即使不购买 Cursor + ChatGPT 订阅,用通义灵码(免费)+ 开源 MCP 工具也能搭建可用的 AI 逆向工作流,降低了实践门槛。
  • IDA Pro MCP 增强版值得关注:idapromcp333 在原版基础上增加了结构体自动声明、反调试逻辑识别、基础算法识别(加密/哈希)等高级功能,这些正是 Native 层逆向最耗时的环节。

来源链接


5. Agentic Scraping 时代:Scrapling MCP + BrowserAct 三层反爬体系

事件内容
2026 年上半年,AI 爬虫领域出现了一个新范式——“代理爬虫”(Agentic Scraping)。与传统的”固定脚本线性执行”不同,代理爬虫是”目标驱动”的:AI 根据当前页面 DOM 结构即时生成提取策略,遇到阻拦自动切换绕过方式,甚至能跨多会话维持状态。两个代表性项目值得关注:

Scrapling MCP Server

Scrapling 是一个自适应爬虫框架,其 MCP Server 暴露了 10 种工具,覆盖从基本 HTTP 请求到动态页面渲染、Cloudflare 绕过、批量提取和会话管理。核心亮点:

  • stealthy_fetch:专门绕过 Cloudflare Turnstile 和其他反 Bot 机制
  • CSS 选择器预过滤:AI Agent 只需要特定区块数据时,先用 CSS 选择器裁切目标区块,再送 LLM 分析——大幅节省 token 消耗
  • 支持批量操作(bulk_get / bulk_fetch / bulk_stealthy_fetch)和会话管理

BrowserAct(2.4K+ Stars)

BrowserAct 为 AI Agent 打造了浏览器底层执行层,核心是 三层渐进式反爬防御:

层级 能力 作用
环境层 指纹伪装 + TLS 轮换 + 代理切换 让 90%+ 反爬检测根本不触发
执行层 solve-captcha 自动破解 + stealth-extract 零配置提取 真遇到验证码也能自己过
人类层 remote-assist 生成可访问链接 AI 搞不定时让人类扫码/手动完成,Agent 无缝继续

三种浏览器模式:Chrome(复用本地登录态)/ Stealth(全套真人指纹伪装)/ 隔离模式。

值得关注的原因

  • 从”模拟用户”到”成为用户”:传统 Playwright/Selenium 本质是”模拟用户”——开隔离无头浏览器,特征明显。BrowserAct 和 bb-browser 等新工具直接通过 CDP 接管真实 Chrome,继承真实登录态和指纹,从根源上规避检测。这种思路比传统的”加固无头浏览器指纹”更彻底。
  • MCP 协议成为爬虫与 AI 的标准桥梁:Scrapling MCP、Scrapfly MCP、Firecrawl MCP——主流爬虫工具纷纷提供 MCP Server,这意味着 AI Agent 可以像调用函数一样调用爬虫能力,无需编写胶水代码。
  • 人类兜底设计值得借鉴:BrowserAct 的三层防御承认 AI 有解决不了的问题(如扫码登录、企业 SSO),将人类作为最后一层安全网融入自动化流程——这种”AI 优先 + 人类兜底”的设计理念对逆向工程工具同样适用。

来源链接


补充关注

以下为今日 AIHOT 精选中的间接相关动态,供参考:

动态 来源 与逆向/爬虫的关联
前沿模型实际成本:tokenizer 差异导致隐性涨价(Claude 新 tokenizer 比旧版多产生约 30% token) playcode.io AI 逆向工具(如 JSIMPLIFIER 的 LLM 重命名、js-reverse-pro-mcp 的 AI 辅助)的运行成本受 tokenizer 影响,选型时需考虑
OpenAI 发布面向普通用户的提示词指南:从结果出发,少写步骤 The Decoder 对编写 AI 逆向 MCP 的 Skill/提示词有直接指导意义
腾讯混元 HyOCR-1.5:端到端 OCR 大模型全栈开源,1B 参数推理提速 6.37 倍 腾讯混元公众号 OCR 是爬虫数据提取和安卓逆向 UI 自动化的基础能力,开源 1B 模型可在本地部署

本日报由自动化任务每日 07:00 自动生成,聚焦 AI 在 JS 逆向、安卓逆向和爬虫领域的前沿动态。