🐍 你用PHP爬取过数据吗?

阿轩的BUG
文章191
评论56
标签101
站点日志
作者总数:1位
置顶文章:0篇
标签总数:101条
文章总数:196篇
评论总数:56条
微语总数:201条
运行天数:2319天
最近更新:2026-07-28
文章标签
最新评论
Sherlock
2025-08-21
不是应该打包成apk文件吗,怎么突然就运行编译了,下一步呢
老金er
2025-05-25
人生设计非常必要,在信息化发达的今天,周围大部分人依然只能过着人生工程模式生活,长时间生活洗礼后,尽管“人生工程”已经不再适合很多人,他们也无法做出任何改变,人生设计给我们提供了新的思路,值得尝试
赏帮赚
2025-05-25
职场太多的尔虞我诈
三笑
2024-08-16
emlog6.0.1可以升级支持吗?
pony
2024-07-08
这篇文章提供了一种新的人生规划方法——"人生设计",它借鉴了产品设计的理念,鼓励人们以创造性和探索性的方式思考和规划自己的生活。以下是对这篇文章的几个评价维度: 创新性:将产品设计的理念应用于人生规划是一个新颖的视角,为人们提供了一种跳出传统生活轨迹,探索个性化生活路径的方法。 实用性:文章不仅提出了理念,还详细介绍了具体的实施步骤,包括自我评估、制定计划、原型设计和实践选择等,具有很强的操作性。 启发性:通过强调好奇心、不断尝试、重新定义问题等心态,文章鼓励人们打破常规,勇于探索未知,这对于激发个人潜能和创造力具有积极作用。 适应性:"人生设计"理念适用于不同人生阶段和不同背景的人,无论是希望从头开始的人,还是已经取得一定成就但希望探索新方向的人,都可以从中获得启发。 情感共鸣:文章对许多人对传统生活轨迹的不满和对改变的渴望进行了深刻的洞察,能够引起读者的共鸣。 可持续性:人生设计强调的是一个持续迭代和试错的过程,这与现实生活的发展规律相吻合,有助于人们在不断变化的环境中做出适应性调整。 教育意义:作为一种人生规划方法,"人生设计"可以作为教育的一部分,帮助年轻人更早地学会自我探索和规划,为未来的生活和职业发展打下基础。 局限性:尽管"人生设计"提供了一种新的思考框架,但它可能需要个人具备一定的自我认知和反思能力,对于一些缺乏自我探索经验的人来说,可能需要额外的指导和支持。 总体来说,这篇文章提供了一种有价值的人生规划方法,对于那些渴望改变、寻求个性化生活的人来说,是一种有益的参考和指导。
首页值得一看 🔍️

PHP除了做服务端开发已经,也是可以像Python一样来爬取数据的。

我认为爬取数据有两种实现思路:

1种是请求数据接口,解析json数据

另外1种是获得网页的dom树,解析dom树,获得数据。

今天重点介绍第二种,引用php的一个插件:simple_html_dom,解析json的思路也提一下。

解析json

解析json这种方式很好理解,所有支持请求网络的开发语言都能支持

思路就是获得爬取链接返回的json数据(也可以是其他类型的数据,json比较常用)

我们拿到json数据后进行解析,结合自身需求来处理数据。

这个比较通用,就不举例子了。

解析dom树

重点讲解一下PHP是如何爬取目标网站,解析dom树的。

举个栗子:

工具类代码:

做了缓存处理,我的场景只要请求的url相同返回的数据是不变的,所以做了缓存处理

请求的url之前请求通,不会重复请求,而是会从缓存中取值

sleep()的作用是避免给抓取数据的网站造成网络问题,控制一下请求频率

public static function crawlContent($url, $encode = true)
{
    $file_name = '../cache/' . md5($url);
    if (!file_exists($file_name)) {
        @touch($file_name);
    }
    $content = file_get_contents($file_name);
    if (empty($content)) {
        $content = Request::curl($url);
        if (empty($content)) {
            sleep(rand(3,10));
            $content = Request::curl($url);
        }
        $encode && $content = iconv("GBK", "UTF-8//IGNORE", $content);
        file_put_contents($file_name, $content);
    }
    return $content;
}

封装的 curl 工具

public static function curl($url , $configs = array())
{
    $b = microtime(true);
    $new_ch = curl_init();
    self::_setopt($new_ch , $url , $configs);
    $result = curl_exec($new_ch);
    $e = microtime(true);
    if (curl_errno($new_ch))
    {
        Logger::log('CULR_BAD    ' . "curl_errno:" . curl_errno($new_ch) . "    " . curl_error($new_ch) . "    " . ($e - $b) . "    " . $url);
    }
    curl_close($new_ch);
    return $result;
}

解析dom树示例代码

上面的工具类代码我们获得了目标网页的数据

通过 str_get_html 函数获得字符串

再按照 simple_html_dom 获得元素的方式获得对应的值就可以了了

比如:


find('#container');

// 找到所有class=foo的元素
$ret = $html->find('.foo');

// 查找多个html标签
$ret = $html->find('a, img');

// 还可以这样用
$ret = $html->find('a[title], img[title]');
?>

更多取值方法可以查看官方文档,非常的简单好用,这里就不再这里赘述了。

我的示例代码

下面是我的示例代码,整理了一些爬取数据时需要注意的问题:

  1. 如果涉及抓取图片的话,最好把图片上传到自己的云存储

  2. 合理的控制爬取频率(已封装到工具类中)

  3. 合理的使用代理(已封装到工具类中)

find('.m-o-large-all-detail .ui-box .ui-box-body ul li');
            if ($content) {
                $counts = count($content);
                for ($i = 0; $i < $counts; $i++) {
                    $name = trim($detail_html->find('.m-o-large-all-detail .ui-box .ui-box-body ul li .detail h3 a', $i)->plaintext); //名称
                    $href = 'https:'.trim($detail_html->find('.m-o-large-all-detail .ui-box .ui-box-body ul li .detail h3 a', $i)->href); //url
                    preg_match_all('/[1-9]\d*/', $href, $matches);
                    $source_id = $matches[0][0];
                    $price = trim($detail_html->find('.m-o-large-all-detail .ui-box .ui-box-body ul li .cost b', $i)->plaintext); //价格
                    $data = array(
                        'name' => $name,
                        'source_url' => $href,
                        'source_id' => $source_id,
                        'price'=>$price,
                        'created_at'=>date('Y-m-d H:i:s'),
                        'date'=>date('m-d'),
                    );
                    $id = $spider->insert('products', $data);
                    var_dump("商品信息:products_" . $id);
                    if ($id){
                        //存储图片
                        catchThumbs($id,$href,$spider);
                    }
                }
            }
        }
    }
}

//抓取商品图
function catchThumbs($id,$detail_url,$spider)
{
    $m_content = Utils::curlProxy($detail_url, false);

    $before = strpos($m_content, 'imagePathList');
    $after = strpos($m_content,'ImageModule',1);
    $count = $after-$before-24;

    $thumbs = substr($m_content,$before+15,$count);

    $data = array(
        'thumbs'=>$thumbs,
        'updated_at'=>date('Y-m-d H:i:s'),
    );
    $res = $spider->update('products', $data, 'id = '.$id);
    var_dump('抓取商品图:'.$res." id=".$id);
    if ($res){
        //更新成功则下载图片
        downloadThumbs($id,$thumbs,$spider);
    }
}

//下载商品图
function downloadThumbs($id,$thumbs,$spider)
{
        $Ymd = date('md');
        $thumbs = json_decode($thumbs,true);
        foreach ($thumbs as $key=> $thumb){
            $image_name = $Ymd.'-'.$id.'-'.($key+1).'.jpg';
            $image_name = './pics/'.$image_name;
            saveImage($thumb,$image_name);
        }
}

/**
 * 从网上下载图片保存到服务器
 * @param $path 图片网址
 * @param $image_name 保存到服务器的路径 './public/upload/users_avatar/'.time()
 */
function saveImage($path, $image_name) {
    $ch = curl_init ($path);
    curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
    curl_setopt($ch, CURLOPT_BINARYTRANSFER,1);
    $img = curl_exec ($ch);
    curl_close ($ch);
//$image_name就是要保存到什么路径,默认只写文件名的话保存到根目录
    $fp = fopen($image_name,'w');//保存的文件名称用的是链接里面的名称
    fwrite($fp, $img);
    fclose($fp);
}

总结和注意

以上就是PHP爬取数据的思路总结啦~

注意:在未经授权的情况下爬取数据是违法的!

本文仅提供爬取数据的PHP实现思路,网络世界不是法外之地,谨慎使用爬取技术哦~

上一篇
📝 Laravel 的运行机制——容器、控制反转、依赖注入
下一篇
🐢 Git使用实战:多人协同开发,紧急修复线上bug的Git操作指南。