六狼论坛

 找回密码
 立即注册

QQ登录

只需一步,快速开始

新浪微博账号登陆

只需一步,快速开始

搜索
查看: 55|回复: 0

新闻抓取爬虫 PPT

[复制链接]

升级  69.33%

42

主题

42

主题

42

主题

秀才

Rank: 2

积分
154
 楼主| 发表于 2013-1-15 02:29:21 | 显示全部楼层 |阅读模式
不用多言,请见附件 :)

上slideshare view  -> http://www.slideshare.net/edisonlz/ppt-4395676

补充,不使用分词的,很简单,但效果一般的排重算法如下:

#encoding = utf8import re import sys,osimport rechars = []def generate_chars(strList):    """    创建字典    """    for sr in strList:        for char in sr:            if char not in chars:                chars.append(char)def vector(sr):    """    将字符串转换为向量空间    """    vec = []    for char in chars:        if sr.find(char) !=-1:            vec.append(1)        else:            vec.append(0)    return vecdef intersaction(str1,str2):    """    计算交集    """    v1 =vector(str1)    v2= vector(str2)    rv = 0    for i in xrange(len(v1)):        rv += v1 * v2    return rvdef detect_repeat(strList):    """    检测字符串字符匹配    """    chars = generate_chars(strList)        #临界值    critical = 3    results = []    for st in strList:        if all(intersaction(st,rt) < critical  for rt in results):            results.append(st)        #返回检测结果    return resultsif __name__ =="__main__":    strLists = [u"大家好啊",u"大家好",u"张靓颖新专辑",u"张靓颖专辑"]    results = detect_repeat(strLists)    print "result " + " > " * 20    for ru in results:        print ru.encode("utf-8")
您需要登录后才可以回帖 登录 | 立即注册 新浪微博账号登陆

本版积分规则

快速回复 返回顶部 返回列表