php多线程抓取网页( 2018年05月31日17:28:50投稿:mrr)

优采云发布时间: 2022-02-19 18:01

　　php多线程抓取网页(

2018年05月31日17:28:50投稿:mrr)

　　python面向对象多线程爬虫爬取搜狐页面示例代码

　　更新时间：2018-05-31 17:28:50 投稿：mrr

　　本文章主要介绍python面向对象多线程爬虫爬取搜狐页面的示例代码。有需要的朋友可以参考以下

　　首先我们需要几个包：requests、lxml、bs4、pymongo、redis

　　1. 创建一个爬虫对象有几个行为：抓取页面、解析页面、提取页面、存储页面

　　class Spider(object):

def __init__(self):

# 状态(是否工作)

self.status = SpiderStatus.IDLE

# 抓取页面

def fetch(self, current_url):

pass

# 解析页面

def parse(self, html_page):

pass

# 抽取页面

def extract(self, html_page):

pass

# 储存页面

def store(self, data_dict):

pass

　　2. 设置爬虫的属性。我们用一个类来封装，不用爬爬爬。@unique 使其中的元素独一无二。枚举和唯一需要从枚举表面导入：

　　@unique

class SpiderStatus(Enum):

IDLE = 0

WORKING = 1

　　3. 覆盖多线程类：

　　class SpiderThread(Thread):

def __init__(self, spider, tasks):

super().__init__(daemon=True)

self.spider = spider

self.tasks = tasks

def run(self):

while True:

pass

　　4. 现在爬虫的基本结构已经完成，要在main函数中创建任务，需要从队列中导入Queue：

　　def main():

# list没有锁，所以使用Queue比较安全, task_queue=[]也可以使用,Queue 是先进先出结构, 即 FIFO

task_queue = Queue()

# 往队列放*敏*感*词*url, 即搜狐手机端的url

task_queue.put('http://m.sohu,com/')

# 指定起多少个线程

spider_threads = [SpiderThread(Spider(), task_queue) for _ in range(10)]

for spider_thread in spider_threads:

spider_thread.start()

# 控制主线程不能停下,如果队列里有东西，任务不能停, 或者spider处于工作状态，也不能停

while task_queue.empty() or is_any_alive(spider_threads):

pass

print('Over')

　　4-1.和is_any_threads是判断线程中是否有蜘蛛还活着，所以我们再写一个函数封装一下：

　　def is_any_alive(spider_threads):

return any([spider_thread.spider.status == SpiderStatus.WORKING

for spider_thread in spider_threads])

　　5. 结构体都写好了，接下来就是填写爬虫的代码了。在SpiderThread(Thread)中，开始编写运行爬虫的方法，即线程启动后要做什么：

　　 def run(self):

while True:

# 获取url

current_url = self.tasks_queue.get()

visited_urls.add(current_url)

# 把爬虫的status改成working

self.spider.status = SpiderStatus.WORKING

# 获取页面

html_page = self.spider.fetch(current_url)

# 判断页面是否为空

if html_page not in [None, '']:

# 去解析这个页面, 拿到列表

url_links = self.spider.parse(html_page)

# 把解析完的结构加到 self.tasks_queue里面来

# 没有一次性添加到队列的方法用循环添加算求了

for url_link in url_links:

self.tasks_queue.put(url_link)

# 完成任务，状态变回IDLE

self.spider.status = SpiderStatus.IDLE

　　6. 现在可以开始编写 Spider() 类中的四个方法，首先编写 fetch() 抓取页面：

　　@Retry()

def fetch(self, current_url, *, charsets=('utf-8', ), user_agent=None, proxies=None):

thread_name = current_thread().name

print(f'[{thread_name}]: {current_url}')

headers = {'user-agent': user_agent} if user_agent else {}

resp = requests.get(current_url,

headers=headers, proxies=proxies)

# 判断状态码，只要200的页面

return decode_page(resp.content, charsets) \

if resp.status_code == 200 else None

　　6-1. decode_page 是我们在类外封装的解码函数：

　　def decode_page(page_bytes, charsets=('utf-8',)):

page_html = None

for charset in charsets:

try:

page_html = page_bytes.decode(charset)

break

except UnicodeDecodeError:

pass

# logging.error('Decode:', error)

return page_html

　　6-2. @retry 是重试的装饰器，因为需要传参数，这里我们用一个类来包装，所以最后改成@Retry()：

　　# retry的类，重试次数3次，时间5秒(这样写在装饰器就不用传参数类), 异常

class Retry(object):

def __init__(self, *, retry_times=3, wait_secs=5, errors=(Exception, )):

self.retry_times = retry_times

self.wait_secs = wait_secs

self.errors = errors

# call 方法传参

def __call__(self, fn):

def wrapper(*args, **kwargs):

for _ in range(self.retry_times):

try:

return fn(*args, **kwargs)

except self.errors as e:

# 打日志

logging.error(e)

# 最小避让 self.wait_secs 再发起请求(最小避让时间)

sleep((random() + 1) * self.wait_secs)

return None

return wrapper()

　　7. 接下来，编写解析页面的方法，即parse()：

　　# 解析页面

def parse(self, html_page, *, domain='m.sohu.com'):

soup = BeautifulSoup(html_page, 'lxml')

url_links = []

# 找body的有 href 属性的 a 标签

for a_tag in soup.body.select('a[href]'):

# 拿到这个属性

parser = urlparse(a_tag.attrs['href'])

netloc = parser.netloc or domain

scheme = parser.scheme or 'http'

netloc = parser.netloc or 'm.sohu.com'

# 只爬取 domain 底下的

if scheme != 'javascript' and netloc == domain:

path = parser.path

query = '?' + parser.query if parser.query else ''

full_url = f'{scheme}://{netloc}{path}{query}'

if full_url not in visited_urls:

url_links.append(full_url)

return url_links

　　7-1.我们需要在SpiderThread()的run方法中，在

　　current_url = self.tasks_queue.get()

　　在下面添加

　　visited_urls.add(current_url)

　　在课堂外添加另一个

　　visited_urls = set()去重

　　8. 现在可以开始抓取相应的 URL。

　　总结

　　以上就是小编为大家介绍的python面向对象多线程爬虫爬取搜狐页面的示例代码。我希望它对你有帮助。有任何问题请给我留言，小编会及时回复你的。还要感谢大家对脚本之家网站的支持！

0

2022-02-19

php多线程抓取网页

0 个评论

要回复文章请先登录或注册

AI时代内容工厂

php多线程抓取网页( 2018年05月31日17:28:50投稿:mrr)

0 个评论

发起人