PHP抓取及分析网页的方法详解
作者:布鲁斯大人 发布时间:2023-11-24 08:17:10
标签:PHP,抓取网页
本文实例讲述了PHP抓取及分析网页的方法。分享给大家供大家参考,具体如下:
抓取和分析一个文件是非常简单的事。这个教程将通过一个例子带领你一步一步地去实现它。让我们开始吧!
首先,我首必须决定我们将抓取的URL地址。可以通过在脚本中设定或通过$QUERY_STRING传递。为了简单起见,让我们将变量直接设在脚本中。
<?php
$url = 'http://www.php.net';
?>
第二步,我们抓取指定文件,并且通过file()函数将它存在一个数组里。
<?php
$url = 'http://www.php.net';
$lines_array = file($url);
?>
好了,现在在数组里已经有了文件了。但是,我们想分析的文本可能不全在一行里面。为了解决这个文件,我们可以简单地将数组$lines_array转化成一个字符串。我们可以使用implode(x,y)函数来实现它。如果在后面你想用explode(将字符串变量数组),将x设成"|"或"!"或其它类似的分隔符可能会更好。但是出于我们的目的,最好将x设成空格。y是另一个必要的参数,因为它是你想用implode()处理的数组。
<?php
$url = 'http://www.php.net';
$lines_array = file($url);
$lines_string = implode('', $lines_array);
?>
现在,抓取工作就做完了,下面该进行分析了。出于这个例子的目的,我们想得到在<head>到</head>之间的所有东西。为了分析出字符串,我们还需要叫做正规表达式的东西。
<?php
$url = 'http://www.php.net';
$lines_array = file($url);
$lines_string = implode('', $lines_array);
eregi("<head>(.*)</head>", $lines_string, $head);
?>
让我们看一下代码。正如你所见,eregi()函数按下面的格式执行:
eregi("<head>(.*)</head>", $lines_string, $head);
"(.*)"表示所有东西,可以解释为,"分析在<head>和</head>间的所以东西"。$lines_string是我们正在分析的字符串,$head是分析后的结果存放的数组。
最后,我们可以输数据。因为仅在<head>和</head>间存在一个实例,我们可以安全的假设数组中仅存在着一个元素,而且就是我们想要的。让我们把它打印出来吧。
<?php
$url = 'http://www.php.net';
$lines_array = file($url);
$lines_string = implode('', $lines_array); eregi("<head>(.*)</head>", $lines_string, $head);
echo $head[0];
?>
这就是全部的代码了。
<?php
//获取所有内容url保存到文件
function get_index ( $save_file , $prefix = "index_" ){
$count = 68 ;
$i = 1 ;
if ( file_exists ( $save_file )) @ unlink ( $save_file );
$fp = fopen ( $save_file , "a+" ) or die( "Open " . $save_file . " failed" );
while( $i < $count ){
$url = $prefix . $i . ".htm" ;
echo "Get " . $url . "..." ;
$url_str = get_content_url ( get_url ( $url ));
echo " OK/n" ;
fwrite ( $fp , $url_str );
++ $i ;
}
fclose ( $fp );
}
//获取目标多媒体对象
function get_object ( $url_file , $save_file , $split = "|--:**:--|" ){
if (! file_exists ( $url_file )) die( $url_file . " not exist" );
$file_arr = file ( $url_file );
if (! is_array ( $file_arr ) || empty( $file_arr )) die( $url_file . " not content" );
$url_arr = array_unique ( $file_arr );
if ( file_exists ( $save_file )) @ unlink ( $save_file );
$fp = fopen ( $save_file , "a+" ) or die( "Open save file " . $save_file . " failed" );
foreach( $url_arr as $url ){
if (empty( $url )) continue;
echo "Get " . $url . "..." ;
$html_str = get_url ( $url );
echo $html_str ;
echo $url ;
exit;
$obj_str = get_content_object ( $html_str );
echo " OK/n" ;
fwrite ( $fp , $obj_str );
}
fclose ( $fp );
}
//遍历目录获取文件内容
function get_dir ( $save_file , $dir ){
$dp = opendir ( $dir );
if ( file_exists ( $save_file )) @ unlink ( $save_file );
$fp = fopen ( $save_file , "a+" ) or die( "Open save file " . $save_file . " failed" );
while(( $file = readdir ( $dp )) != false ){
if ( $file != "." && $file != ".." ){
echo "Read file " . $file . "..." ;
$file_content = file_get_contents ( $dir . $file );
$obj_str = get_content_object ( $file_content );
echo " OK/n" ;
fwrite ( $fp , $obj_str );
}
}
fclose ( $fp );
}
//获取指定url内容
function get_url ( $url ){
$reg = '/^http:////[^//].+$/' ;
if (! preg_match ( $reg , $url )) die( $url . " invalid" );
$fp = fopen ( $url , "r" ) or die( "Open url: " . $url . " failed." );
while( $fc = fread ( $fp , 8192 )){
$content .= $fc ;
}
fclose ( $fp );
if (empty( $content )){
die( "Get url: " . $url . " content failed." );
}
return $content ;
}
//使用socket获取指定网页
function get_content_by_socket ( $url , $host ){
$fp = fsockopen ( $host , 80 ) or die( "Open " . $url . " failed" );
$header = "GET /" . $url . " HTTP/1.1/r/n" ;
$header .= "Accept: */*/r/n" ;
$header .= "Accept-Language: zh-cn/r/n" ;
$header .= "Accept-Encoding: gzip, deflate/r/n" ;
$header .= "User-Agent: Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; Maxthon; InfoPath.1; .NET CLR 2.0.50727)/r/n" ;
$header .= "Host: " . $host . "/r/n" ;
$header .= "Connection: Keep-Alive/r/n" ;
//$header .= "Cookie: cnzz02=2; rtime=1; ltime=1148456424859; cnzz_eid=56601755-/r/n/r/n";
$header .= "Connection: Close/r/n/r/n" ;
fwrite ( $fp , $header );
while (! feof ( $fp )) {
$contents .= fgets ( $fp , 8192 );
}
fclose ( $fp );
return $contents ;
}
//获取指定内容里的url
function get_content_url ( $host_url , $file_contents ){
//$reg = '/^(#|<a href="http://lib.csdn.net/base/18" class='replace_word' title="JavaScript知识库" target='_blank' style='color:#df3434; font-weight:bold;'>JavaScript</a>.*?|ftp:////.+|http:////.+|.*?href.*?|play.*?|index.*?|.*?asp)+$/i';
//$reg = '/^(down.*?/.html|/d+_/d+/.htm.*?)$/i';
$rex = "/([hH][rR][eE][Ff])/s*=/s*['/"]*([^>'/"/s]+)[/"'>]*/s*/i" ;
$reg = '/^(down.*?/.html)$/i' ;
preg_match_all ( $rex , $file_contents , $r );
$result = "" ; //array();
foreach( $r as $c ){
if ( is_array ( $c )){
foreach( $c as $d ){
if ( preg_match ( $reg , $d )){ $result .= $host_url . $d . "/n" ; }
}
}
}
return $result ;
}
//获取指定内容中的多媒体文件
function get_content_object ( $str , $split = "|--:**:--|" ){
$regx = "/href/s*=/s*['/"]*([^>'/"/s]+)[/"'>]*/s*(.*?<//b>)/i" ;
preg_match_all ( $regx , $str , $result );
if ( count ( $result ) == 3 ){
$result [ 2 ] = str_replace ( "多媒体: " , "" , $result [ 2 ]);
$result [ 2 ] = str_replace ( " " , "" , $result [ 2 ]);
$result = $result [ 1 ][ 0 ] . $split . $result [ 2 ][ 0 ] . "/n" ;
}
return $result ;
}
?>
希望本文所述对大家PHP程序设计有所帮助。
0
投稿
猜你喜欢
- 过年这段时间由于线上数据库经常压力过大导致响应非常缓慢甚至死机,咬咬牙下大决心来解决效率不高的问题!首先是由于公司秉承快速开发原则,频繁上线
- 大多数做过网页设计的都知道“CSS框架”,而且肯定有很多设计师已经开始在作品中使用CSS框架。就像其他编程语言一样,CSS也可以把一些重复使
- 此BUG最初是在《前端观察》网站刊登,这里再描述一下,代码如下:<style>*{ padding:0; m
- 如果您的网站面向世界各地的冲浪者或者对外开展商贸活动,检测来访者的浏览器语言类型就非常现实了。这里提供的脚本可以检测流露;浏览器
- 在Twinsen Liang的博客上看到一篇名为语义化单单的限定在html么?的文章,文中主要是提及了CSS的命名规则,仔细阅读后,我认为这
- 没注意到MooTools的Cookie类在写的时候自己做了一次encode,在读的时候做了一次decode,在一般的情况下,这个不会有什么问
- 第一题:ASP中,VBScript的唯一的数据类型是什么?第二题:在ASP中,VBScript有多种控制程序流程语句,如If…Then, S
- 转:coolcode.cn前几天写了一篇在任意字符集下正常显示网页的方法,里面介绍的很简单,就是把前128个字符以外的字符集都用
- <%'***********************************************'函数
- vbscript脚本中,fso对象CreateTextFile方法调用时可能会报“无效的过程调用或参数”错误,在使用ASP生成静态页面时,如
- 如何在ADO服务器端利用好缓存技术?请看下面示例,这是一个用来显示图书分类的例子程序:displayBooks.asp< %
- 在推广Web标准的今天,那些崇尚Web标准的人经常说XHTML比HTML更加严格,当然从某种意义上说是的,比如它要求所有的标签关闭并且所有的
- PHP Session 变量当运行一个应用程序时,你会打开它,做些更改,然后关闭它。这很像一次会话。计算机清楚你是谁。它知道你何时启动应用程
- 原来的程序是使用sqlite这个嵌入式数据库作为Remit(code name)的数据源的,因为NHibernate支持这个,然而有一点不好
- 发现ie7的空格间距要比ie6/firefox/opera的都要宽一点。比如有时候排版的时候,我会采用简单的空格来分隔。<div&nb
- 代码如下:Create PROCEDURE Batch_Delete @TableName nvarchar(100), --表
- 译者按:我们时常能看到不同JavaScript库/框架之间的各种比较,但这次 YUI3 架构师和 jQuery 之父的直接对话却非常难得,也
- 1.今天网上下载一个博客项目,发现本地访问,js,css加载不了.我想应该是项目上线的安全措施,但是我想调试项目.找到方法如下在settin
- 笔者日积月累了许多精彩、实用的Web特效的制作,这些特效几乎都是比较常用的网页特效。现在我就把这些经过
- asp连接mysql的问题ASP连接Mysql数据库的问题。下了一个MySql 的ODBC驱动。做了个小测试。顺利通过。先记录下来,中间还有