edisonlz 发表于 2013-1-28 18:51:45

新闻抓取爬虫 PPT

不用多言,请见附件 :)

上slideshare view-> http://www.slideshare.net/edisonlz/ppt-4395676

补充,不使用分词的,很简单,但效果一般的排重算法如下:

#encoding = utf8import re import sys,osimport rechars = []def generate_chars(strList):    """    创建字典    """    for sr in strList:      for char in sr:            if char not in chars:                chars.append(char)def vector(sr):    """    将字符串转换为向量空间    """    vec = []    for char in chars:      if sr.find(char) !=-1:            vec.append(1)      else:            vec.append(0)    return vecdef intersaction(str1,str2):    """    计算交集    """    v1 =vector(str1)    v2= vector(str2)    rv = 0    for i in xrange(len(v1)):      rv += v1 * v2    return rvdef detect_repeat(strList):    """    检测字符串字符匹配    """    chars = generate_chars(strList)      #临界值    critical = 3    results = []    for st in strList:      if all(intersaction(st,rt) < criticalfor rt in results):            results.append(st)      #返回检测结果    return resultsif __name__ =="__main__":    strLists =     results = detect_repeat(strLists)    print "result " + " > " * 20    for ru in results:      print ru.encode("utf-8")
页: [1]
查看完整版本: 新闻抓取爬虫 PPT