php抓取网页源码(本文使用Python3的requests包抓取并保存网页源码的方法)

优采云 发布时间: 2022-02-06 15:06

  php抓取网页源码(本文使用Python3的requests包抓取并保存网页源码的方法)

  本文中的示例描述了Python3如何使用requests包来抓取和保存网页的源代码。分享给大家参考,详情如下:

  使用 Python 3 的 requests 模块抓取网页源代码并将其保存到文件示例:

  导入请求

  html = requests.get("")

  使用 open('test.txt','w',encoding='utf-8') 作为 f:

  f.write(html.text)

  这是一个基本的文件保存操作,但这里有几个问题值得注意:

  1.安装requests包,在命令行输入pip install requests自动安装。很多人推荐使用requests,内置的urllib.request也可以爬取网页的源码

  2.open方法的encoding参数设置为utf-8,否则保存的文件会乱码。

  3.如果直接在cmd中输出抓取的内容,会提示各种编码错误,所以保存到文件中查看。

  4.with open 方法是比较好的写法,自动运行后可以释放资源。

  另一个例子:

  导入请求

  ff = open('testt.txt','w',encoding='utf-8')

  使用 open('test.txt',encoding="utf-8") 作为 f:

  对于 f 中的行:

  ff.write(行)

  ff.close()

  这是一个示例,演示读取一个 txt 文件,一次一行,并保存到另一个 txt 文件。

  因为每次读取一行的数据是在命令行打印的,所以中文会出现编码错误,所以每次读取一行,保存到另一个文件中,测试读取是否正常。(注意开启时指定编码编码方式)

  更多Python3中如何使用requests包抓取和保存网页源代码文章请关注PHP中文网!

  本文原创发表于php中文网,转载请注明出处,感谢您的尊重!

0 个评论

要回复文章请先登录注册


官方客服QQ群

微信人工客服

QQ人工客服


线