暂无搜索历史
一、重新定义问题:爬虫是一类有状态的流处理任务长周期爬虫(任务跨度数天、采集千万级页面)在工程上不应被当成"脚本",而应被建模为一条有状态的流处理管道:待爬 U...
引言:为什么要把热榜落库前几篇我们已经解决了「怎么抓」——用 httpx 监听百度金融 sapi/v1/ranks 接口,拿到了 A股、美股、基金三类实时热榜。...
销售日报需要汇总各渠道的订单数、销售额和客单价。渠道超过十个以后,手工把数据从各平台抄进同一张 Excel 就成了明显负担:耗时、易错、且无法追溯数据来源。以 ...
折腾了两周,把线上 12 个 Scrapy 爬虫项目全部迁移到 Crawlo。期间踩了 8 个大坑,有些坑文档里一个字都没提。这篇文章就是一份完整的迁移复盘,希...
如果你动手写过 B 站爬虫,大概率撞上过这一幕:第一页的动态数据顺利到手,翻到第二页接口马上甩回 {"code": -352, "message": "请求过于...
一、为什么要"像人一样"爬新手脚本常出现"第一跑通、第二被封",根因是机器人流量在统计特征上与真人差异明显:请求间隔高度规律(sleep(2) 方差≈0);Us...
二手车是典型的非标品:同一款车,因为上牌年份、行驶里程、所在城市、车况等级不同,价格能差出好几万。汽车之家二手车(che168.com)聚合了全国大量真实成交记...
短视频运营中存在一个普遍盲区:创作者只能通过抖音后台查看当前时刻的累计指标,无法获取指标的时序演化过程。然而,抖音推荐系统采用多级流量池递进机制——视频发布后先...
搜狗微信(weixin.sogou.com)是公众号文章监测的常用入口,信任状态挂在 Cookie 上。过了点选验证码之后,SNUID、SUV 这类凭证有时效,...
关键词:CustomTkinter · Trio · Modbus TCP · 结构化并发 · 共享状态层 · 上位机一、为什么把 Modbus 轮询托管给 T...
很多人一听到「散户情绪」就觉得是玄学,仿佛只有盘面高手靠直觉才能感知。其实东方财富股吧里每天几百万条发帖,就是最原始的散户情绪池子。帖子里有人喊「满仓干」,有人...
前段时间有个需求,要批量采集某个关键词相关的新闻数据做舆情分析。选了一圈数据源,最后落在新浪新闻搜索上。原因有几个:收录量大,搜索结果带时间戳和来源媒体字段,数...
在构建离线旅行攻略时,需要把去哪儿网游记中的图集批量抓取并整理为本地 Markdown 电子书。技术上的主要障碍并非反爬,而是图片懒加载:页面中数十张图片在初始...
你写的 Scrapy 爬虫跑了一晚上,库里还是空的。第一反应通常是目标站反爬升级,或者 XPath 写错。这两种都有可能,但我遇到更多的是代理压根没生效:请求用...
超时设 3 秒,跑半小时成功率从 98% 掉到 85%。目标站点 RTT 正常,代理 IP 存活,但大量请求抛 ServerTimeoutError。问题出在超...
做SEO的人迟早会遇到一个问题:你想知道自己的页面在某个关键词下排第几。手动搜一次两次没问题,但如果你要追踪几百个关键词、每周更新一次、还要跟竞品对比,手动就不...
在跨境电商选品和竞品监控中,Lazada 的商品页包含标题、价格、评分、库存等结构化字段,是比价与趋势分析的数据来源。爬虫把页面拉到内存只是流程的前半段:内存中...
上周 review 一个同事的爬虫脚本,两千多行,注释里写着"已改成异步,性能提升十倍"。我在本地跑了一遍,比同步版本慢了将近一倍。问题出在哪?满屏的 awai...
Python 在内网访问 HTTPS 接口时,常遇到 SSLError: [SSL: CERTIFICATE_VERIFY_FAILED] certificat...
问题定位:不是框架选型错,是执行模型不匹配我们的抓取服务在 Scrapy 上稳定运行了两年,日均调度量从 30 万涨到 3000 万。迁移的动因不是 Scrap...
暂未填写学校和专业