月度归档:2011年04月

别人写的几句话

一个犁牛半块田,收也凭天,荒也凭天,
粗茶淡饭饱三餐,早也香甜,晚也香甜,
布衣得暖胜丝绵,长也可穿,短也可穿,
草舍茅屋有几间,行也安然,待也安然,
雨过天青驾小船,鱼在一边,酒在一边,
夜归儿女话灯前,今也有言,古也有言,
日上三竿我独眠,谁是神仙,我是神仙。

几种常见的PHP中文分词系统

因为要做毕业设计,可能需要相关知识,所以在此总结一下常见的中文分词系统。

1)HTTPCWS – 基于HTTP协议的开源中文分词系统

张宴的作品,基于ICTCLAS 3.0 共享版,分词精度98.45%。可以采用HTTP方式调用借口。

网址:http://blog.s135.com/httpcws_v100/

2)SCWS – 简易中文分词系统

SCWS 在概念上并无创新成分,采用的是自行采集的词频词典,并辅以一定程度上的专有名称、人名、地名、数字年代等规则集,经小范围测试大概准确率在 90% ~ 95% 之间,已能基本满足一些中小型搜索引擎、关键字提取等场合运用。 SCWS 采用纯 C 代码开发,以 Unix-Like OS 为主要平台环境,提供共享函数库,方便植入各种现有软件系统。此外它支持 GBK,UTF-8,BIG5 等汉字编码,切词效率高。

网址:http://www.ftphp.com/scws/

3)PhpanAlysis – PHP无组件分词系统

PhpanAlysis分词系统是基于字符串匹配的分词方法 ,这种方法又叫做机械分词方法,它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。按照扫描方向的不同,串匹配分词方法可以分为正向匹配 和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最短)匹配;按照是否与词性标注过程相结合,又可以分为单纯分词方法和分词与标注相结合的一体化方法。

网址:http://www.itgrass.com/phpanalysis/