多数大学生出来选择的工作和专业无关
首页 > 专业知识

如何利用php数组对百万数据进行排重

时间:2019-01-09 20:13:26 [来源]:郑州PHP培训学校

   如何利用php数组对百万数据进行排重

  在平时的工作中,经常接到要对网站的会员进行站内信、手机短信、email进行群发信息的通知,用户列表一般由别的同事提供,当中难免会有重复,为了避免重复发送,所以我在进行发送信息前要对他们提供的用户列表进行排重,下面我以uid列表来讲讲我是如何利用php数组进行排重的。
  假如得到一个uid列表,数量在百万行以上,格式如下:
  10001000
  10001001
  10001002
  ................
  10001000
  ................
  10001111
  其实利用php数组的特性,很好进行排重,我们先来看一下php数组的定义:PHP 中的数组实际上是一个有序映射。映射是一种把 values 关联到 keys 的类型。此类型在很多方面做了优化,因此可以把它当成真正的数组,或列表(向量),散列表(是映射的一种实现),字典,集合,栈,队列以及更多可能性。数组元素的值也可以是另一个数组。树形结构和多维数组也是允许的。
  在php的数组中,键(keys)也称为索引,具有唯一性,我们正可以利用这一特性进行排重,示例代码如下:
  <PRE><?php//定义一个数组,用于存放排重后的结果$result = array();//读取uid列表文件$fp = fopen('test.txt', 'r');while(!feof($fp)){ $uid = fgets($fp); $uid = trim($uid); $uid = trim($uid, "\r"); $uid = trim($uid, "\n"); if($uid == '') { continue; } //以uid为key去看该值是否存在 if(empty($result[$uid])) { $result[$uid] = 1; }}fclose($fp);//将结果保存到文件$content = '';foreach($result as $k => $v){ $content .= $k."\n";}$fp = fopen('result.txt', 'w');fwrite($fp, $content);fclose($fp);?></PRE>
  20多行代码,就可以对百万以上的数据进行排重,效率也不错,非常实用。手机号、email,也可以采用这种方式进行排重。
  还有,这可方法还可以用于两个文件进行排重的工作,如果你有两个uid列表文件,格式和上面的uid列表一样,示例程序如下:
  <PRE><?php//定义数组,用于存放排重后的结果$result = array();//读取第一个uid列表文件,放入$result_1$fp = fopen('test_1.txt', 'r');while(!feof($fp)){ $uid = fgets($fp); $uid = trim($uid); $uid = trim($uid, "\r"); $uid = trim($uid, "\n"); if($uid == '') { continue; } //以uid为key写入$result,如有重复就会覆盖 $result[$uid] = 1;}fclose($fp);//读取第二个uid列表文件,并进行排重操作$fp = fopen('test_2.txt', 'r');while(!feof($fp)){ $uid = fgets($fp); $uid = trim($uid); $uid = trim($uid, "\r"); $uid = trim($uid, "\n"); if($uid == '') { continue; } //以uid为key去看该值是否存在 if(empty($result[$uid])) { $result[$uid] = 1; }}fclose($fp);//$result里保存的就排重以后的结果,可以输出到文件,代码省略?></PRE>
  仔细想想,不难发现,利用数组的这一特性还可以解决我们工作中的更多问题。
  PHP通用采集程序开发视频教程
  对于许多初级入门的站长来说,站点没有内容的确是一件很痛苦的事情,而采集正好解决了许多新手站长的这样一个问题,它能够将其它站点的信息抓取到自己本地存储进数据库,甚至可以将其内容伪SEO成自己的站点内容。
  1、PHP采集程序构建基本步骤
  2、设计PHP采集入库程序UML
  3、PHP采集入库用到的知识点
  4、进入开发阶段
  file_get_contents() 远程文件获取函数,用来获取远程页面内容preg_match_all()进行全局正则表达式匹配 用于匹配列表preg_match ()进行正则表达式匹配 用于匹配终端preg_replace ()进行正则表达式替换 用于过滤终端复习正则表达式 、 正则修正符用法。
  同时,还附件实例和操作演示,是一期适合众多不同要求的站长的学习视频。
  PHP单线程实现并行抓取网页
  本PHP教程将模拟并行抓取多个页面信息的过程,关键在于单线程的并行处理。
  一般情况下,大家写抓取多个页面信息的程序都采用串行方案,但获取周期过长,不实用。于是我想到用curl 去并行抓取。但是,最后发现,那个虚拟服务器上没有curl,这真是让人纠结。于是,我决定改变思路,用单个线程也实现多个线程的效果。我想对网络编程有点了解的人肯定知道IO复用这个概念,当然PHP上也是支持的,而且,内部支持,不需要任何扩展。
  可能有很多年编程经验的人对PHP的stream 函数可能不太了解。PHP的压缩文件流,文件流,tcp协议下的应用都封装成一个stream。所以,读本地文件和读网络文件没有任何的差别。说了这样多,我想大家都基本上明白了,直接贴上代码吧:
  代码比较的粗糙,如果大家要实际用的话,还是要处理一些细节问题。
  代码
  functionhttp_get_open($url)
  {
  $url=parse_url($url);
  if(empty($url['host'])){
  returnfalse;
  }
  $host=$url['host'];
  if(empty($url['path'])){
  $url['path']="/";
  }
  $get=$url['path']."?".@$url['query'];
  $fp=stream_socket_client("tcp://{$host}:80",$errno,$errstr,30);if(!$fp){
  echo"$errstr($errno)
  \n";
  returnfalse;
  }else{
  fwrite($fp,"GET{$get}HTTP/1.0\r\nHost:{$host}\r\nAccept:*/*\r\n\r\n");}
  return$fp;
  }
  functionhttp_multi_get($urls)
  {
  $result=array();
  $fps=array();
  foreach($urlsas$key=>$url)
  {
  $fp=http_get_open($url);
  if($fp===false){
  $result[$key]=false;
  }else{
  $result[$key]='';
  $fps[$key]=$fp;
  }
  }
  while(1)
  {
  $reads=$fps;
  if(empty($reads)){
  break;
  }
  if(($num=stream_select($reads,$w=null,$e=null,30))===false){echo"error";
  returnfalse;
  }elseif($num>0){//canread
  foreach($readsas$value)
  {
  $key=array_search($value,$fps);
  if(!feof($value)){
  $result[$key].=fread($value,128);
  }else{
  unset($fps[$key]);
  }
  }
 

上一篇:php生成唯一数字id的方法汇总_PHP

下一篇:3种方法实现PHP多线程异步请求