news 2026/8/21 11:20:06

爬虫学习案例3

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
爬虫学习案例3
爬取美女图片

优美图库地址
一页图片

安装依赖库文件
pip install selenium requests beautifulsoup4 import time import requests import random from bs4 import BeautifulSoup from selenium import webdriver from selenium.webdriver.chrome.service import Service from selenium.webdriver.chrome.options import Options # 设置Chrome选项 chrome_options = Options() chrome_options.add_argument("--headless") # 无头模式,不打开浏览器窗口 chrome_options.add_argument("--disable-gpu") chrome_options.add_argument("--no-sandbox") # 设置ChromeDriver路径 service = Service('D:envpython3chromedriver.exe') url = 'https://www.umei.cc/touxiangtupian/nvshengtouxiang/' baseUrl = "https://www.umei.cc" # 初始化WebDriver driver = webdriver.Chrome(service=service, options=chrome_options) driver.get(url) time.sleep(random.uniform(5, 10)) # 等待页面加载 html = driver.page_source # 原页面 soup = BeautifulSoup(html, 'html.parser') # print(soup) # BeautifulSoup分析提取元素 divList = soup.find_all("div",class_= "item masonry_brick") # print(divList) # 一个美女信息 for divItem in divList: linkImage = divItem.find("div",class_ = "item_t").find("div",class_ = "img").find("a")["href"] linkImage = baseUrl + linkImage # 拿去子页面的大图 driver.get(linkImage) time.sleep(random.uniform(5, 10)) html = driver.page_source sonSoup = BeautifulSoup(html, 'html.parser') imgUrl = sonSoup.find("div",class_ = "tsmaincont-main-cont-txt").find("img")["src"] print(f"准备下载图片{imgUrl}") # 下载图片 img_response = requests.get(imgUrl) img_name = imgUrl.split('/')[-1] with open("img"+img_name, "wb") as f: f.write(img_response.content) print(f"图片{img_name}下载完成") print("第一页图片全部下载到当前目录了.....") driver.quit() # 关闭浏览器

爬取多页
import time import requests import random from bs4 import BeautifulSoup from selenium import webdriver from selenium.webdriver.chrome.service import Service from selenium.webdriver.chrome.options import Options # 设置Chrome选项 chrome_options = Options() chrome_options.add_argument("--headless") # 无头模式,不打开浏览器窗口 chrome_options.add_argument("--disable-gpu") chrome_options.add_argument("--no-sandbox") # 设置ChromeDriver路径 service = Service('D:envpython3chromedriver.exe') url = 'https://www.umei.cc/touxiangtupian/nvshengtouxiang/' baseUrl = "https://www.umei.cc" # 初始化WebDriver driver = webdriver.Chrome(service=service, options=chrome_options) def getImage(url,page): driver.get(url) print(f"正在爬取第{page}页图片资源源...") print(url) time.sleep(random.uniform(5, 10)) # 等待页面加载 html = driver.page_source # 原页面 soup = BeautifulSoup(html, 'html.parser') # BeautifulSoup分析提取元素 divList = soup.find_all("div",class_= "item masonry_brick") for divItem in divList: linkImage = divItem.find("div",class_ = "item_t").find("div",class_ = "img").find("a")["href"] linkImage = baseUrl + linkImage # 拿取子页面的大图 driver.get(linkImage) time.sleep(random.uniform(5, 10)) html = driver.page_source sonSoup = BeautifulSoup(html, 'html.parser') imgUrl = sonSoup.find("div",class_ = "tsmaincont-main-cont-txt").find("img")["src"] print(f"准备下载图片{imgUrl}") # 下载图片 img_response = requests.get(imgUrl) img_name = imgUrl.split('/')[-1] with open("img"+img_name, "wb") as f: f.write(img_response.content) print(f"图片{img_name}下载完成") print(f"第{page}页图片全部下载到当前img目录了.....") # 爬取1-10页 # 控制爬取的页面数 for page in range(1, 11): if page == 1: getImage(url,page) else: pageUrl = f"{url}index_{page}.htm" getImage(pageUrl,page) driver.quit() # 关闭浏览器

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/14 16:33:21

SUPER COLORIZER效果深度评测:对比传统PS软件上色的效率与质量

SUPER COLORIZER效果深度评测:对比传统PS软件上色的效率与质量 每次看到那些充满历史感的黑白老照片,你是不是也好奇它们原本的色彩世界是什么样子?过去,想把一张黑白照片变成彩色,那可是个技术活,得请专业…

作者头像 李华
网站建设 2026/7/14 16:33:25

星图AI镜像使用:PETRV2-BEV模型训练与评估全解析

星图AI镜像使用:PETRV2-BEV模型训练与评估全解析 1. 开篇:为什么选择星图AI训练PETRV2? 如果你正在研究自动驾驶的视觉感知技术,特别是基于鸟瞰图(BEV)的3D目标检测,那么PETRV2模型一定在你的…

作者头像 李华
网站建设 2026/7/14 16:33:25

ClearerVoice-Studio效果展示:ASR语音识别前处理提升准确率18.7%实测

ClearerVoice-Studio效果展示:ASR语音识别前处理提升准确率18.7%实测 1. 开篇引言:语音处理的革命性突破 在日常工作和生活中,我们经常遇到这样的困扰:重要的会议录音因为背景噪音而听不清楚,电话采访的音频质量太差…

作者头像 李华
网站建设 2026/7/14 16:33:36

Qwen-Turbo-BF16效果展示:雨夜霓虹反射+体积雾+机械臂材质物理渲染

Qwen-Turbo-BF16效果展示:雨夜霓虹反射体积雾机械臂材质物理渲染 最近在折腾AI生图,发现一个挺有意思的现象:很多号称“高性能”的模型,一到复杂场景就容易“翻车”——要么生成一片漆黑,要么颜色溢出得没法看。特别是…

作者头像 李华
网站建设 2026/7/14 16:33:26

FireRedASR-AED-L本地化部署:支持USB麦克风直连+实时语音识别Demo开发

FireRedASR-AED-L本地化部署:支持USB麦克风直连实时语音识别Demo开发 1. 项目简介 FireRedASR-AED-L是一个基于1.1B参数大模型开发的本地语音识别工具,专为中文、方言和中英混合语音识别场景设计。这个工具最大的特点是完全本地运行,不需要…

作者头像 李华