php 抓取网页源码(本文实例讲述Python3使用requests包抓取并保存网页源码的方法)

优采云 发布时间: 2021-10-12 07:30

  php 抓取网页源码(本文实例讲述Python3使用requests包抓取并保存网页源码的方法)

  本文通过一个示例介绍了 Python3 如何使用 requests 包来捕获和保存网页的源代码。分享给大家,供大家参考,如下:

  使用 Python 3 的 requests 模块抓取网页的源代码并将其保存到文件示例中:

  import requests

html = requests.get("http://www.baidu.com")

with open('test.txt','w',encoding='utf-8') as f:

f.write(html.text)

  这是一个基本的文件保存操作,但这里有几个值得注意的问题:

  1. 安装requests包,在命令行输入pip install requests自动安装。很多人推荐使用requests,内置的urllib.request也可以抓取网页的源码

  2.open方法的编码参数设置为utf-8,否则保存的文件会出现乱码。

  3. 如果直接在cmd中输出抓到的内容,会提示各种编码错误,所以保存成文件查看。

  4.with open 方法是更好的写法,可以在操作完成后自动释放资源。

  另一个例子:

  import requests

ff = open('testt.txt','w',encoding='utf-8')

with open('test.txt',encoding="utf-8") as f:

for line in f:

ff.write(line)

ff.close()

  这是一个演示读取 txt 文件,一次读取一行,然后将其保存到另一个 txt 文件的示例。

  因为打印在命令行中一次读取一行的数据,会出现中文编码错误,所以一次读取一行,保存到另一个文件中,测试读取是否正常。(打开时注意编码方式)

  更多Python3使用requests包抓取并保存网页源码介绍相关文章请关注PHP中文网!

  

  免责声明:本文原创发表于php中文网。转载请注明出处。感谢您的尊重!如果您有任何疑问,请与我们联系

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线