
NLTK(Natural Language Toolkit)是领先的 Python 平台,专为处理人类语言数据而构建。它提供超过 50 个语料库和词汇资源(如 WordNet)的易用接口,以及一套用于分类、分词、词干提取、词性标注、句法分析和语义推理的文本处理库,同时封装了工业级 NLP 库,并拥有活跃的讨论社区。
NLTK 适合语言学家、工程师、学生、教育工作者、研究人员和行业用户。它支持 Windows、macOS 和 Linux,是免费、开源、社区驱动的项目,被评价为“使用 Python 进行计算语言学的教学和工作的绝佳工具”和“玩弄自然语言的惊人库”。
以下代码展示了 NLTK 的基本使用:
import nltk
sentence = """At eight o'clock on Thursday morning
Arthur didn't feel very good."""
tokens = nltk.word_tokenize(sentence)
# 输出分词结果
tagged = nltk.pos_tag(tokens) # 词性标注
entities = nltk.chunk.ne_chunk(tagged) # 命名实体识别

如果使用 NLTK 发表作品,请引用:
Bird, Steven, Edward Loper and Ewan Klein (2009), Natural Language Processing with Python. O’Reilly Media Inc.