异步爬虫aiohttp使用 目录一、背景二、应用场景三、备注一、背景最近有个爬虫需求页面是一个下拉框一个查询按钮但是下拉框里有大概七八百多个选项需求是要尽可能快的爬下来所有选项的数据。问了下AI给出了aiohttp来做异步并发请求之前也是没有用过所以本文记录一下aiohttp使用方法。二、应用场景因为我们这个属于一个爬虫项目框架任务的调度使用的aps管理任务通过数据库查询得到之前都是同步任务运行但这个aiohttp是异步的函数功能所以是要在任务里额外创建一个异步时间循环来运行异步任务。def task(task_idNone, station_idNone, collect_dateNone, province_codeNone): 被aps定时任务查询根据映射执行的具体任务入口 # 创建独立的事件循环 loop asyncio.new_event_loop() asyncio.set_event_loop(loop) try: results loop.run_until_complete(async_crawl_flow()) return results finally: loop.close() class Crawler: ...... _sem asyncio.Semaphore(10) # 控制并发数 async def async_crawl_flow(self): 异步主流程 1. 获取下拉列表拿到所有节点ID 2. 并发查询每个节点详情 timeout ClientTimeout(total30) # aitohttp接受的proxy跟request有区别是一个字符串 proxy_str self.proxy.get(http) or self.proxy.get(https) async with aiohttp.ClientSession( timeouttimeout, headersself.headers, cookiesself.cookie, proxyproxy_str ) as session: print(开始获取下拉列表...) node_list await self._fetch_node_list(session) if not node_list: print(未获取到节点列表流程终止) return [] print(f获取到 {len(node_list)} 个节点ID) print(开始并发查询节点详情...) results await self._fetch_all_details(session, node_list) print(f查询完成成功 {len(results)} 条) return results # # 第一步获取下拉列表 # async def _fetch_node_list(self, session: aiohttp.ClientSession) - list[dict]: 调用下拉列表接口提取所有节点ID try: async with session.post( https://xxx.com, json{} ) as resp: data await resp.json() node_list data.get(data, []) return node_list except Exception as e: print(f获取下拉列表失败: {e}) return [] # # 第二步并发查询详情 # async def _fetch_all_details(self, session: aiohttp.ClientSession, node_list: list[dict]) - dict: 查询所有节点的详情 results [] async def fetch_one_detail(node_info: dict): 查询单个节点详情 id node_info.get(id) name node_info.get(name) async with self._sem: try: async with session.post( https://xxx.com, json{ phyunitId: id, dataTime: self.collect_date, }, timeoutClientTimeout(total10), ) as resp: if resp.status 200: detail_data await resp.json() results[id] detail_data print(f节点 {name} 查询成功) else: print(f节点 {name} 返回状态码: {resp.status}) except asyncio.TimeoutError: print(f节点 {name} 超时) # 创建所有任务并发执行 tasks [fetch_one_detail(nl) for nl in node_list] await asyncio.gather(*tasks, return_exceptionsTrue) return results三、备注异步并发会同时向目标服务器发送n个请求过去注意控制好信号量一般建议在10-30之间左右有些网站会有限流、频繁请求检测等这种情况下并发的请求大部分都拿不到数据需要降低并发量、增加失败重试等机制。

相关新闻

最新新闻

C#集成ChatGPT开发实战:从协议到界面的完整方案

C#集成ChatGPT开发实战:从协议到界面的完整方案

1. 项目概述:C#与ChatGPT的融合开发最近在技术社区看到不少关于C#对接ChatGPT的讨论,作为一个常年混迹.NET生态的老码农,今天想和大家分享一套完整的C#集成ChatGPT解决方案。不同于简单的API调用,我们将从协议层到界面层完整构建一…

2026/7/29 13:28:29
Arduino入门套件选型指南:从零到一,避坑指南与实战推荐

Arduino入门套件选型指南:从零到一,避坑指南与实战推荐

1. 项目概述:为什么你需要一份Arduino入门套件选型指南? 如果你刚刚接触Arduino,打开购物网站,面对琳琅满目的“入门套件”、“学习套件”、“超级套件”,是不是瞬间就懵了?从几十块到上千块,从…

2026/7/29 13:28:29
Matlab非刚性配准算法详解与医学图像处理实践

Matlab非刚性配准算法详解与医学图像处理实践

1. 非刚性配准的核心概念与应用场景非刚性配准(Non-rigid Registration)是医学图像处理和计算机视觉领域的关键技术,用于对齐存在局部形变的图像。与刚性配准只能处理平移和旋转不同,非刚性配准可以处理更复杂的形变,比…

2026/7/29 13:28:29
机器人视觉控制实战:从DFRobot杯赛题到宇树G1跑道居中项目全解析

机器人视觉控制实战:从DFRobot杯赛题到宇树G1跑道居中项目全解析

1. 项目缘起:从“DFRobot杯”看一个赛事的五年沉淀五年前,当“DFRobot杯”这个名字第一次出现在国内创客与机器人教育的视野中时,它可能只是众多科创赛事中的一个新面孔。五年,对于一项赛事而言,足以经历从蹒跚学步到稳…

2026/7/29 13:28:29
核心检索链定义,后面 Agent 会把这个当 Tool 用

核心检索链定义,后面 Agent 会把这个当 Tool 用

我用LangChain搭客服Agent,处理3万条FAQ的实战踩坑前不久接了个电商后台项目,客户是个做家居用品的中型商家,客服团队每天要回两三千条咨询,大多是「发货没」「尺码怎么选」「能不能开发票」这种重复性问题。他们想上个智能客服先…

2026/7/29 13:28:29
AI辅助论文写作:书匠策AI功能解析与实操指南

AI辅助论文写作:书匠策AI功能解析与实操指南

1. 论文写作困境与AI工具的崛起本科论文写作对大多数学生来说都是一场艰苦的修行。从选题迷茫到文献梳理,从框架搭建到内容填充,每个环节都充满挑战。记得我大四写毕业论文时,光是确定研究方向就花了三周时间,文献综述部分更是反复…

2026/7/29 13:23:28

月新闻