2赞

PHP实现简单爬虫的方法

作者：勤奋的瞌睡猪_715 | 2022-01-11 14:13

这篇文章主要介绍了PHP实现简单爬虫的方法,涉及php页面抓取及分析的相关技巧,具有一定参考借鉴价值,需要的朋友可以参考下

本文实例讲述了PHP实现简单爬虫的方法。分享给大家供大家参考。具体如下：

<?php
/**
 * 爬虫程序 -- 原型
 *
 * 从给定的url获取html内容
 * 
 * @param string $url 
 * @return string 
 */
function _getUrlContent($url) {
  $handle = fopen($url, "r");
  if ($handle) {
    $content = stream_get_contents($handle, 1024 * 1024);
    return $content;
  } else {
    return false;
  } 
} 
/**
 * 从html内容中筛选链接
 * 
 * @param string $web_content 
 * @return array 
 */
function _filterUrl($web_content) {
  $reg_tag_a = '/<[a|A].*?href=[\'\"]{0,1}([^>\'\"\ ]*).*?>/';
  $result = preg_match_all($reg_tag_a, $web_content, $match_result);
  if ($result) {
    return $match_result[1];
  } 
} 
/**
 * 修正相对路径
 * 
 * @param string $base_url 
 * @param array $url_list 
 * @return array 
 */
function _reviseUrl($base_url, $url_list) {
  $url_info = parse_url($base_url);
  $base_url = $url_info["scheme"] . '://';
  if ($url_info["user"] && $url_info["pass"]) {
    $base_url .= $url_info["user"] . ":" . $url_info["pass"] . "@";
  } 
  $base_url .= $url_info["host"];
  if ($url_info["port"]) {
    $base_url .= ":" . $url_info["port"];
  } 
  $base_url .= $url_info["path"];
  print_r($base_url);
  if (is_array($url_list)) {
    foreach ($url_list as $url_item) {
      if (preg_match('/^http/', $url_item)) {
        // 已经是完整的url
        $result[] = $url_item;
      } else {
        // 不完整的url
        $real_url = $base_url . '/' . $url_item;
        $result[] = $real_url;
      } 
    } 
    return $result;
  } else {
    return;
  } 
} 
/**
 * 爬虫
 * 
 * @param string $url 
 * @return array 
 */
function crawler($url) {
  $content = _getUrlContent($url);
  if ($content) {
    $url_list = _reviseUrl($url, _filterUrl($content));
    if ($url_list) {
      return $url_list;
    } else {
      return ;
    } 
  } else {
    return ;
  } 
} 
/**
 * 测试用主程序
 */
function main() {
  $current_url = "http://hao123.com/"; //初始url
  $fp_puts = fopen("url.txt", "ab"); //记录url列表
  $fp_gets = fopen("url.txt", "r"); //保存url列表
  do {
    $result_url_arr = crawler($current_url);
    if ($result_url_arr) {
      foreach ($result_url_arr as $url) {
        fputs($fp_puts, $url . "\r\n");
      } 
    } 
  } while ($current_url = fgets($fp_gets, 1024)); //不断获得url
} 
main();
?>

希望本文所述对大家的php程序设计有所帮助。

推荐阅读

程序员
在switch语句中通过引用返回

如何解决《在switch语句中通过引用返回》经验，为你挑选了1个好方法。 ... [详细]
程序员
Visual Studio 2015 IIS Express 500错误

如何解决《VisualStudio2015IISExpress500错误》经验，为你挑选了0个好方法。 ... [详细]
程序员
从snake_case到camel

如何解决《从snake_case到camel》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何找到哪个Java/Scala线程锁定了文件？

如何解决《如何找到哪个Java/Scala线程锁定了文件？》经验，为你挑选了1个好方法。 ... [详细]
程序员
swift .framework更新导致'使用未声明的类型错误'

如何解决《swift.framework更新导致'使用未声明的类型错误'》经验，为你挑选了1个好方法。 ... [详细]
程序员
无法绑定到'ng-forOf',因为它不是已知的本机属性

如何解决《无法绑定到'ng-forOf',因为它不是已知的本机属性》经验，为你挑选了5个好方法。 ... [详细]
程序员
如何将一些使用语句设置为不冗余,即使它们是多余的？

如何解决《如何将一些使用语句设置为不冗余,即使它们是多余的？》经验，为你挑选了1个好方法。 ... [详细]
程序员
我可以安全地使用Amazon的Elasticsearch和Rails searchkick gem吗？

如何解决《我可以安全地使用Amazon的Elasticsearch和Railssearchkickgem吗？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Spring @RequestParam和控制器接口

如何解决《Spring@RequestParam和控制器接口》经验，为你挑选了0个好方法。 ... [详细]
程序员
将ES6"import"转换为nodejs"require"的正确方法

如何解决《将ES6"import"转换为nodejs"require"的正确方法》经验，为你挑选了1个好方法。 ... [详细]
程序员
当另一组CompletableFutures完成后,您如何完成CompletableFuture？

如何解决《当另一组CompletableFutures完成后,您如何完成CompletableFuture？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何访问Angular2中的HTML视频元素

如何解决《如何访问Angular2中的HTML视频元素》经验，为你挑选了1个好方法。 ... [详细]
程序员
从神经网络的不同成本函数和激活函数中选择

如何解决《从神经网络的不同成本函数和激活函数中选择》经验，为你挑选了1个好方法。 ... [详细]
程序员
在NSStackView中拖动视图以重新排列顺序

如何解决《在NSStackView中拖动视图以重新排列顺序》经验，为你挑选了1个好方法。 ... [详细]
程序员
Android onResume和onCreate

如何解决《AndroidonResume和onCreate》经验，为你挑选了1个好方法。 ... [详细]
程序员
无法删除或更新父行:外键约束失败 - 删除博客中的帖子

如何解决《无法删除或更新父行:外键约束失败-删除博客中的帖子》经验，为你挑选了1个好方法。 ... [详细]
程序员
应该在左侧或右侧检查null

如何解决《应该在左侧或右侧检查null》经验，为你挑选了1个好方法。 ... [详细]
程序员
与RxJava结合了解Android内存泄漏

如何解决《与RxJava结合了解Android内存泄漏》经验，为你挑选了1个好方法。 ... [详细]
程序员
我可以在Prolog找到一本关于"确定条款文法"的详尽书籍吗？

如何解决《我可以在Prolog找到一本关于"确定条款文法"的详尽书籍吗？》经验，为你挑选了0个好方法。 ... [详细]
程序员
.htaccess:非www到www(带https)在Firefox中显示ssl_error_bad_cert_domain

如何解决《.htaccess:非www到www(带https)在Firefox中显示ssl_error_bad_cert_domain》经验，为你挑选了0个好方法。 ... [详细]

勤奋的瞌睡猪_715

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章