主要产品:省钱快报 App,属于电商导购类产品,对接淘宝、京东、拼多多等平台,日活用户 300 万+。
Project 01
分布式爬虫任务调度系统
成果:负责 80+ 爬虫、200+ 队列的任务调度,日调度任务超过 5 亿次。
- 通过 HTTP 接口进行爬虫和任务队列注册,支持设置最大队列大小、单个任务队列抓取速度和监控报警阈值。
- 支持多节点部署,自动检测节点添加和异常退出,提高调度能力和可用性。
- 动态调节不同队列的抓取速度,提高代理利用率。
- 支持优先级任务组,自动控制待调度队列的整体大小。
Project 02
Cookie 池服务和通用模拟登录平台
成果:管理淘宝爬虫使用的 Cookie,支持淘宝等网站的模拟登录,降低环境搭建成本,并向实时优惠引擎和招商计划等业务提供 Cookie。
- 通用 Cookie 使用 Redis 构建环形队列,特殊账号使用 Hash 结构存储。
- 使用 Puppeteer 和 Express 搭建常见网站的登录服务平台。
- 移除浏览器特征,并支持模拟移动端。
- 支持执行 JavaScript 脚本,通过脚本模拟点击和滑动验证码等交互。
Project 03
淘宝优惠信息实时引擎
成果:提供 15+ 种优惠信息,包括店铺券、满减满折和红包等,覆盖商品 400 万+。
- 研究淘宝反爬虫策略,开发通用淘宝 Sign 解密和 Cookie 使用中间件等进行规避。
- 持续优化数据链路,挖掘不同接口关系,通过历史数据分析字段含义,降低代理使用成本并防止任务积压。
- 对接 Feed、商品点击、搜索等不同数据源,及时发现商品的新优惠类型。
- 建设 Scrapy 分布式抓取集群,并使用 ScrapydWeb 管理平台。
Project 04
商品库建设
成果:每日对 7000 万+ 商品完成多次更新。
- 重构商品库系统,将爬虫脚本迁移到 Scrapy,使用 Kafka 解耦,并将数据发送到 Kafka 供中台和搜索等业务消费。
- 对商品库进行分层,包括秒杀、曝光商品和商品打分机制等,针对不同层级采用不同更新频率,降低信息延迟。
- 二次开发 scrapy-redis,使用 Pipeline 支持批量获取任务,爬虫整体性能提升约 30%。
- 利用不同接口对商品价格进行验证,提升价格准确性。
- 优化数据链路,使用 Redis Hash 对商品不同维度的 Kafka 消息去重,日去重超过 1.5 亿。
- 建设新任务过滤器模块,以配置化规则过滤敏感词、类目黑名单和发货时间过长的商品,提升灵活性。
Project 05
爬虫监控 / 数据持久化
成果:使用 InfluxDB、Grafana、Fluentd 等工具构建监控数据平台。
- 构建 Scrapy 扩展,统一收集爬虫指标。
- 使用 Fluentd 收集爬虫核心业务数据并写入 MongoDB 集群。
- 优化 MongoDB 集群性能,不使用 TTL 特性,改为按天分割数据。