9. 生成器
Python 生成器详解:yield 关键字与生成器函数的挂起机制,return 与 yield 的区别,生成器表达式的惰性计算与内存优势,及 send/close 方法的用法。
9. 迭代器
Python 迭代器详解:可迭代对象与迭代器的区别,iter/next 与 StopIteration,自定义 __iter__/__next__ 实现迭代器,for 循环的本质及学生系统遍历练习。
03. 数据提取方法-beautifulsoup4
BeautifulSoup4 解析实战:四种解析器对比,find_all/find 的正则与列表过滤、class_ 匹配,CSS 选择器与 get_text 取值,附免费代理 IP 列表提取案例。
03. 数据提取方法-xpath
xpath 数据提取详解:路径表达式与节点定位语法、position/last() 索引、contains 等常用函数,lxml 解析与 tostring 排错,「先分组再提取」实战模式,附豆瓣 Top250 练习。
03. 数据提取方法-正则表达式
正则表达式系统教程:match/search/findall/sub 五大方法对比,贪婪与非贪婪、分组引用与命名分组、re.S 修饰符,附邮箱、手机号、IP 等常用正则速查与提取 csrfToken 实战。
03. 数据提取方法-xml和json数据
json 与 xml 数据提取:json 模块四方法与 ensure_ascii 中文处理,从杂乱响应中定位数据字段的思路,xml.etree 解析与 XPath 表达式查询的常用 API。
10. 爬虫-网站信息入库
自动化 SRC 之数据入库:搭建 LNMP 环境作分布式漏扫服务器,设计 srcinfo/urlinfo/postinfo 三张表存储网站信息、爬取状态与 GET/POST 接口数据。
8. 漏扫-端口指纹识别脚本
自动化 SRC 之端口指纹识别:多线程获取端口 banner 后按规则匹配指纹的脚本实现,基于 socket 的指纹库编写思路。
9. 爬虫-测试点及验证网站是否存活并获取网站指纹
自动化 SRC 之存活验证:整理域名-IP-端口对应关系输出网站列表,通过 header 信息判断存活并计算网站特征去重,附非 HTTP 服务端口的测试点分析。
7. 漏扫-解析ip并做端口扫描
自动化 SRC 之端口扫描:域名解析 IP 与去重的数据格式约定,socket 与 dns.resolver 双方案解析、masscan/naabu 批量端口扫描并组合网站链接。
6. 爬虫-借助第三方工具实现子域名枚举
自动化 SRC 之子域名枚举:第三方平台查询、DNS 字典暴力枚举等主流子域名收集方法,含 rapiddns 与 OneForAll 集成平台的利用思路。
5. 爬虫-被动子域名信息收集快速获取
自动化 SRC 之被动子域名收集:面对十几万目标域名,放弃 oneforall 等逐个枚举的低效路线,用多线程快速拉取被动子域名数据的实现思路。

















