
Beautiful Soup 是一个可以从 HTML 或 XML 文件中提取数据的 Python 库。它能够通过你喜欢的转换器实现惯用的文档导航、查找、修改文档的方式,帮助开发者节省数小时甚至数天的工作时间。
本网站为 Beautiful Soup 4.4.0 文档的中文版本(对应 Beautiful Soup 4,简称 BS4)。文档介绍了 BeautifulSoup 4 中所有主要特性,并配有小例子,展示其适合做什么、如何工作、怎样使用、如何达到想要的效果以及处理异常情况。文档中的例子在 Python 2.7 和 Python 3.2 中执行结果相同。
注意:Beautiful Soup 3 目前已停止开发,官方推荐在现在的项目中使用 Beautiful Soup 4。
name 和 attributes 等重要属性,支持遍历与搜索文档树。soup.title 获取标题,soup.find_all('a') 查找所有 <a> 标签,soup.get_text() 获取全部文字内容。html.parser):内置、速度适中、容错强(旧版 Python 容错差)。apt-get install Python-bs4)、PyPi(pip install beautifulsoup4 或 easy_install beautifulsoup4)或源码(python setup.py install)安装。BS4 兼容 Python 2 和 Python 3。pip install lxml)或 html5lib(pip install html5lib)。No module named HTMLParser;反之报 No module named html.parser,需重新安装 BS4。如有关于 BeautifulSoup 的问题,可发送邮件到讨论组。若问题包含需转换的 HTML 代码,应在描述中附带该 HTML 文档的代码诊断。