利用selenium爬虫抓取数据的基础教程

作者：勤奋的瞌睡猪_715 | 2022-02-22 14:20

写在前面本来这篇文章该几个月前写的，后来忙着忙着就给忘记了。ps:事多有时候反倒会耽误事。几个月前，记得群里一朋友说想用selenium去爬数据，关于爬数据，一般是模拟访问某些固定网站，将自己关注的信息进行爬取，然后再将爬出的数据进行处理。他的需求是将文章直接导入到富文本编辑器去发布，其实这也是爬虫

写在前面

本来这篇文章该几个月前写的，后来忙着忙着就给忘记了。

ps:事多有时候反倒会耽误事。

几个月前，记得群里一朋友说想用selenium去爬数据，关于爬数据，一般是模拟访问某些固定网站，将自己关注的信息进行爬取，然后再将爬出的数据进行处理。

他的需求是将文章直接导入到富文本编辑器去发布，其实这也是爬虫中的一种。

其实这也并不难，就是UI自动化的过程，下面让我们开始吧。

准备工具/原料

1、java语言

2、IDEA开发工具

3、jdk1.8

4、selenium-server-standalone（3.0以上版本）

步骤

1、分解需求：

需求重点主要是要保证原文格式样式都保留：

将要爬取文章,全选并复制

将复制后的文本，粘贴到富文本编辑器中即可

2、代码实现思路：

键盘事件模拟CTRL+A全选

键盘事件模拟CTRL+C复制

键盘事件模拟CTRL+V粘贴

3、实例代码

import org.junit.AfterClass;
import org.junit.BeforeClass;
import org.junit.Test;
import org.openqa.selenium.By;
import org.openqa.selenium.WebDriver;
import org.openqa.selenium.chrome.ChromeDriver;

import java.awt.*;
import java.awt.event.KeyEvent;
import java.util.concurrent.TimeUnit;

/**
 * @author rongrong
 * Selenium模拟访问网站爬虫操作代码示例
 */
public class Demo {
 private static WebDriver driver;
 static final int MAX_TIMEOUT_IN_SECONDS = 5;

 @BeforeClass
 public static void setUpBeforeClass() throws Exception {
  driver = new ChromeDriver();
  String url = "https://temai.snssdk.com/article/feed/index?id=6675245569071383053&subscribe=5501679303&source_type=28&content_type=1&create_user_id=34013&adid=__AID__&tt_group_id=6675245569071383053";
  driver.manage().window().maximize();
  driver.manage().timeouts().implicitlyWait(MAX_TIMEOUT_IN_SECONDS, TimeUnit.SECONDS);
  driver.get(url);
 }

 @AfterClass
 public static void tearDownAfterClass() throws Exception {
  if (driver != null) {
   System.out.println("运行结束！");
   driver.quit();
  }
 }

 @Test
 public void test() throws InterruptedException {
  Robot robot = null;
  try {
   robot = new Robot();
  } catch (AWTException e1) {
   e1.printStackTrace();
  }
  robot.keyPress(KeyEvent.VK_CONTROL);
  robot.keyPress(KeyEvent.VK_A);
  robot.keyRelease(KeyEvent.VK_A);
  Thread.sleep(2000);
  robot.keyPress(KeyEvent.VK_C);
  robot.keyRelease(KeyEvent.VK_C);
  robot.keyRelease(KeyEvent.VK_CONTROL);
  driver.get("https://ueditor.baidu.com/website/onlinedemo.html");
  Thread.sleep(2000);
  driver.switchTo().frame(0);
  driver.findElement(By.tagName("body")).click();
  robot.keyPress(KeyEvent.VK_CONTROL);
  robot.keyPress(KeyEvent.VK_V);
  robot.keyRelease(KeyEvent.VK_V);
  robot.keyRelease(KeyEvent.VK_CONTROL);
  Thread.sleep(2000);
 }
}

写在后面

笔者并不是特别建议使用selenium做爬虫，原因如下：

速度慢:

每次运行爬虫都要打开一个浏览器，初始化还需要加载图片、JS渲染等等一大堆东西；

占用资源太多:

有人说，把换成无头浏览器，原理都是一样的，都是打开浏览器，而且很多网站会验证参数，如果对方看到你恶意请求访问，会办了你的请求，然后你又要考虑更换请求头的事情，事情复杂程度不知道多了多少，还得去改代码，麻烦死了。

对网络的要求会更高:

加载了很多可能对您没有价值的补充文件（如css，js和图像文件）。与真正需要的资源（使用单独的HTTP请求）相比，这可能会产生更多的流量。

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对的支持。

推荐阅读

程序员
使用python/django进行日期时间本地化

如何解决《使用python/django进行日期时间本地化》经验，为你挑选了0个好方法。 ... [详细]
程序员
newScheduledThreadPool（）方法的参数“ corePoolSize”是什么意思？

如何解决《newScheduledThreadPool（）方法的参数“corePoolSize”是什么意思？》经验，为你挑选了1个好方法。 ... [详细]
程序员
在PHP 7中键入提示 - 对象数组

如何解决《在PHP7中键入提示-对象数组》经验，为你挑选了3个好方法。 ... [详细]
程序员
为什么此导航栏上方有空格

如何解决《为什么此导航栏上方有空格》经验，为你挑选了2个好方法。 ... [详细]
程序员
是否可能在一个反应组件中有两个状态

如何解决《是否可能在一个反应组件中有两个状态》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何在R包传单中添加比例尺？

如何解决《如何在R包传单中添加比例尺？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Plivo红宝石宝石类冲突

如何解决《Plivo红宝石宝石类冲突》经验，为你挑选了1个好方法。 ... [详细]
程序员
比较C#对象

如何解决《比较C#对象》经验，为你挑选了1个好方法。 ... [详细]
程序员
简单的ASP经典程序不起作用

如何解决《简单的ASP经典程序不起作用》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何检查字典中是否存在键值对？

如何解决《如何检查字典中是否存在键值对？》经验，为你挑选了2个好方法。 ... [详细]
程序员
将值传递给路由

如何解决《将值传递给路由》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从AppVeyor发布beta nuget包

如何解决《如何从AppVeyor发布betanuget包》经验，为你挑选了1个好方法。 ... [详细]
程序员
Python导入结构

如何解决《Python导入结构》经验，为你挑选了0个好方法。 ... [详细]
程序员
UIRefreshControl显示在UICollectionViews Cells之上

如何解决《UIRefreshControl显示在UICollectionViewsCells之上》经验，为你挑选了1个好方法。 ... [详细]
程序员
C++析构函数分段错误

如何解决《C++析构函数分段错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
Scala Slick:永无止境

如何解决《ScalaSlick:永无止境》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在不在浏览器中打开页面的情况下运行ASP.NET 5

如何解决《如何在不在浏览器中打开页面的情况下运行ASP.NET5》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用Swift Package Manager添加目标依赖项时出错

如何解决《使用SwiftPackageManager添加目标依赖项时出错》经验，为你挑选了1个好方法。 ... [详细]
程序员
检查列的每一行是否在范围内

如何解决《检查列的每一行是否在范围内》经验，为你挑选了1个好方法。 ... [详细]
程序员
TcpClient通过NetworkStream BinaryReader / BinaryWriter传输的字节计数

如何解决《TcpClient通过NetworkStreamBinaryReader/BinaryWriter传输的字节计数》经验，为你挑选了0个好方法。 ... [详细]

勤奋的瞌睡猪_715

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章