avatar
文章
533
标签
122
分类
88
首页
时间轴
标签
分类
List
  • 音乐
  • 照片
  • 电影
友链
关于
晚上十一点睡觉のBlog04-数据存储 返回首页
搜索
首页
时间轴
标签
分类
List
  • 音乐
  • 照片
  • 电影
友链
关于

04-数据存储

发表于2023-01-16|更新于2026-10-04|PythonPython爬虫和JS逆向
|总字数:9|阅读时长:1分钟|浏览量:|评论数:
文章作者: 晚上十一点睡觉
文章链接: https://11pmsleep.gungnir.top/posts/53640/
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 晚上十一点睡觉のBlog!
Python爬虫私密笔记数据库
cover of previous post
上一篇
SSRF靶场练习
SSRF 靶场练习笔记:PTE 靶场 Tomcat PUT 上传拿 flag、file 协议读本地文件,burp 抓包做内网主机存活与端口探测的多台靶机实战记录。
cover of next post
下一篇
05-高性能爬虫
高性能爬虫并发方案对比与实战:多线程 threading + Queue 生产者消费者、线程池、多进程与 GIL 说明,aiohttp/asyncio 异步协程与 aiomysql 异步入库,附爱奇艺、LOL 皮肤等完整案例。
相关推荐
cover
2023-06-08
03. 数据提取方法-beautifulsoup4
BeautifulSoup4 解析实战:四种解析器对比,find_all/find 的正则与列表过滤、class_ 匹配,CSS 选择器与 get_text 取值,附免费代理 IP 列表提取案例。
cover
2023-03-22
feapder框架
feapder 爬虫框架教程:AirSpider/Spider/BatchSpider 三种爬虫的场景与架构,数据入库 item 与 download_midware,内置浏览器渲染与 XHR 接口拦截免逆向取数,京东自动化实战演示滚动翻页采集。
cover
2023-03-02
15-哈希算法与逆向
哈希算法逆向实战合集:MD5/SHA/HMAC 的特征识别与 JS、Python 双端实现,通过密文长度反推算法,案例覆盖汽车之家 MD5、红人点集加盐 SHA256、企查查 HmacSHA512 签名头。
cover
2023-01-20
05-高性能爬虫
高性能爬虫并发方案对比与实战:多线程 threading + Queue 生产者消费者、线程池、多进程与 GIL 说明,aiohttp/asyncio 异步协程与 aiomysql 异步入库,附爱奇艺、LOL 皮肤等完整案例。
cover
2023-06-08
03. 数据提取方法-xml和json数据
json 与 xml 数据提取:json 模块四方法与 ensure_ascii 中文处理,从杂乱响应中定位数据字段的思路,xml.etree 解析与 XPath 表达式查询的常用 API。
cover
2023-03-09
18-WebPack打包
WebPack 打包机制与逆向扣代码教程:加载器与模块结构解析、webpackJsonp 多文件加载,36kr、中国五矿等案例的模块扣取流程,附条件断点自动收集依赖与 webpack_mixer 半自动合并脚本。

评论
avatar
晚上十一点睡觉
个人学习日志,学习领域:网络安全和Python爬虫。近一年blog更新至语雀,等有时间再推送至此,后续blog会以全新版本进行发布
文章
533
标签
122
分类
88
Follow Me
公告
stay passionate and never say die
目录
  1. 1. 文本文件数据存储
    1. 1.1. 文本存储
    2. 1.2. 以TXT文本形式存储
  2. 2. json文件存储
    1. 2.1. 对象和数组
    2. 2.2. json模块方法
      1. 2.2.1. json.dump()
    3. 2.3. json模块实际操作
  3. 3. 表格文件数据存储
    1. 3.1. 读取csv文件
      1. 3.1.1. 使用reader函数
      2. 3.1.2. 使用DictReader
    2. 3.2. 写入CSV文件
      1. 3.2.1. 单行写入writerow:
      2. 3.2.2. 多行写入writerows
      3. 3.2.3. 字典写入DictWriter
    3. 3.3. 爬虫采集入库
  4. 4. MySQL存储
    1. 4.1. 准备工作
    2. 4.2. 连接数据库
    3. 4.3. 创建数据表
    4. 4.4. 插入数据
    5. 4.5. 爬虫数据采集入库
  5. 5. MongoDB存储
    1. 5.1. MongoDB简介
    2. 5.2. 连接 MongoDB
    3. 5.3. 指定数据库和表
    4. 5.4. 插入数据
    5. 5.5. 爬虫数据采集入库
  6. 6. 视频 存储
  7. 7. 练习
    1. 7.1. 目标:
    2. 7.2. 存入mongodb:
    3. 7.3. 存入mysql:
    4. 7.4. 疑问:怎么提取描述???
  8. 8. 数据去重
    1. 8.1. 哈希算法
    2. 8.2. 布隆过滤器算法
    3. 8.3. 数据库去重
      1. 8.3.1. mongodb在插入数据环节避免数据重复的方法
      2. 8.3.2. redis去重
    4. 8.4. 基于集合
    5. 8.5. scrapy框架去重设计
    6. 8.6. nutch 去重
    7. 8.7. pandas去重
  9. 9. 分布式去重架构(Bloom Filter + Hash + Redis Cluster)
    1. 9.1. 一、整体流程
    2. 9.2. 二、各部分作用
      1. 9.2.1. 1. 数据采集层
      2. 9.2.2. 2. Hash计算
      3. 9.2.3. 3. Bloom Filter(第一层去重)
      4. 9.2.4. 4. Redis Cluster(第二层去重)
        1. 9.2.4.1. 三、为什么要Redis Cluster
      5. 9.2.5. 5. 持久化层
    3. 9.3. 三、为什么不用Redis直接去重?
    4. 9.4. SI、面试标准回答(背下来)
最新文章
集团流量链路
集团流量链路2026-10-04
6-小红书环境一致性风控与逐项排查实战
6-小红书环境一致性风控与逐项排查实战2026-10-04
4-小红书签名体系与风控实战
4-小红书签名体系与风控实战2026-10-04
Linux-Shell脚本学习
Linux-Shell脚本学习2026-10-04
Linux-Kali配置与使用
Linux-Kali配置与使用2026-10-04
© 2022 - 2026 By 晚上十一点睡觉
Welcome to 11pmsleep's blog ~~~ Blog仅供个人记录笔记学习所用,若有侵权,联系我删除~若有错误,也望诸君不吝指正
搜索
数据加载中