图片自动采集网站源码分享 采集图片的网站

其实图片自动采集网站源码分享的问题并不复杂,但是又很多的朋友都不太了解采集图片的网站,因此呢,今天小编就来为大家分享图片自动采集网站源码分享的一些知识,希望可以帮助到大家,下面我们一起来看看这个问题的分析吧!

小编,近期学习了一些python的凤毛菱角,就开始迫不及待的试试水,写了一个爬取百度贴吧单页图片的程序。以下是战果。特发帖记录一下。(小编用的python3.6版本)

效果:

自动爬取并下载图片到本地:

代码:

其实很简单,我们直接看下整体的代码:

解析:

第一行的utf-8是为了支持中文。

这里我们导入了两个库,分别是urllib.request和re。request是用来进行url网络请求的,而re是一个正则表达式匹配的库。这里我们要先对网站进行模拟请求,然后找到网站中的图片进行下载。

第一个方法:getHtml。

用来抓取网页源代码。想查看源代码的同学可以在末尾加入“print(html)”即可。也可以打开网页右键—>图片->审查元素即可查看到网页源码。

方法二:getImg

在这个方法中,我们设置了一个正则表达式,用来在网页源代码中找到图片的资源路径,这个正则表达式要根据不同的网站去具体设置,比如我爬取的这个网站,图片对应的源代码是这样的:reg=r’src=”(http.*?\\.jpg)”‘,获取到网页图片的链接。之后要做的就是下载了。

方法三:DL

最后一步就是下载图片,这里我们用for循环,将图片资源路径中的每个图片,使用request库的urlretrieve函数来下载图片,这个函数其实可以接受很多参数,这里我们设置了要下载的图片资源路径和要命名的名字(我们使用一个变量num来对每个图片依次命名为1,2…),还可以设置下载路径、用来显示下载进度的回调函数等等。如果不设置下载路径默认会下载到代码文件当前所在的文件夹。

源代码:

python3

imglist=re.findall(imgre,html)

returnimglist

num=1

defDl(title):

fornuminrange(1,len(title)):

urllib.request.urlretrieve(title[num],’%s.jpg’%num)

num+=1

html=getHtml(“https://tieba.baidu.com/p/2957576690?fr=good”)

title=getImg(html)

Dl(title)

因为小编还是新手所以写的不周的地方,大神请见谅。有想和小编交流的小伙伴也可以在下面留言。

好了,关于图片自动采集网站源码分享和采集图片的网站的问题到这里结束啦,希望可以解决您的问题哈!

站内搜索