Hello World — 我的第一篇博客
欢迎来到我的技术博客!这里将记录我在编程、架构和日常开发中的思考与实践。
从单机到集群:分布式爬虫后端架构设计指南
设计一套完整的分布式爬虫系统——任务队列派发、VPS 集群执行、Kafka 数据总线分发、多数据库(MySQL/MongoDB/ES/Doris/Redis)各司其职,包含故障处理和容错设计。
Scrapy 架构深度解析:每个文件在框架中扮演什么角色
以 PDF 批量下载项目为实例,逐文件拆解 Scrapy 项目结构(settings.py、spider、middlewares、pipelines、items),解释引擎-调度器-下载器-爬虫-管道五层架构的协作原理。
用 Scrapy 批量下载网站 PDF:从 14 个索引页到 3176 份文件
从多个 HTML 索引页面出发,递归爬取目标域名下的所有 PDF 文件,最终下载 3176 个 PDF(1.8GB)。详解 Scrapy 爬虫设计思路、Content-Type 过滤、非 HTML 扩展名跳过、JOBDIR 持久化等实战技巧。
从零构建 Google Trends 爬虫 API:单文件架构的工程实践
详解一个基于 Flask + Playwright 的 Google Trends 热搜数据采集服务,涵盖双解析策略降级、指数退避重试、Pending 离线缓存、假成功防御等生产级工程实践。
全异步 Yahoo 热门新闻爬虫:模块化架构与三路数据输出实践
详解一个基于 Python asyncio + Playwright + Kafka 的 Yahoo Trending 新闻爬虫,涵盖双引擎降级策略、7种选择器链、asyncio 与同步 requests 混用方案,以及本地 JSON、Kafka、ODS 三路并行数据输出设计。
Go 错误处理的 8 个反模式(学习整理)
整理自 Go语言中文网 polarisxu 的文章。盘点 Go 里 8 个"看起来在处理、其实在埋雷"的错误处理写法,并给出正确姿势。
列表和元组,到底用哪一个?
从可变性、性能到语义层面,一次讲清 Python 里 list 和 tuple 到底该怎么选。
Go string 不可变?不,是你的用法不可变——一份实战避坑手册
不讲概念讲实战。从 5 个真实翻车场景出发,带你看清 Go string 不可变设计在工程中到底意味着什么,以及如何正确使用。
Go string 原理:为什么 string 是不可变的
从 runtime 源码出发,深入理解 Go string 不可变的设计哲学、底层实现、性能代价和常见陷阱
Fzy
Full-Stack Developer · Tech Enthusiast · Lifelong Learner
公告
欢迎来到我的博客!这是一则示例公告。
分类
标签
站点统计
文章
19
分类
10
标签
50
总字数
35,030
运行时长
0
最后活动
0 天前

目录