Beautiful Soup 中文文档

Beautiful Soup 中文文档

Beautiful Soup 中文文档

访问网站
我的收藏186 次访问更新于 a month ago反馈
Beautiful Soup 中文文档 screenshot

详细介绍

Beautiful Soup 中文文档

简介

Beautiful Soup 是一个可以从 HTML 或 XML 文件中提取数据的 Python 库。它能够通过你喜欢的转换器实现惯用的文档导航、查找、修改文档的方式,帮助开发者节省数小时甚至数天的工作时间。

本网站为 Beautiful Soup 4.4.0 文档的中文版本(对应 Beautiful Soup 4,简称 BS4)。文档介绍了 BeautifulSoup 4 中所有主要特性,并配有小例子,展示其适合做什么、如何工作、怎样使用、如何达到想要的效果以及处理异常情况。文档中的例子在 Python 2.7 和 Python 3.2 中执行结果相同。

注意:Beautiful Soup 3 目前已停止开发,官方推荐在现在的项目中使用 Beautiful Soup 4。

主要功能

  • 解析 HTML/XML 文档:将文档传入 BeautifulSoup 构造方法,可传入字符串或文件句柄,文档会被转换成 Unicode,并选择最合适的解析器进行解析。
  • 文档树操作:将复杂 HTML 文档转换成树形结构,节点归纳为 4 种对象:Tag、NavigableString、BeautifulSoup、Comment。
    • Tag 对象与原生 tag 相同,具有 nameattributes 等重要属性,支持遍历与搜索文档树。
  • 数据提取与浏览:可快速浏览结构化数据,例如获取标题、所有链接、文本内容等。
    • 示例:使用 soup.title 获取标题,soup.find_all('a') 查找所有 <a> 标签,soup.get_text() 获取全部文字内容。
  • 多种解析器支持
    • Python 标准库(html.parser):内置、速度适中、容错强(旧版 Python 容错差)。
    • lxml HTML/XML 解析器:速度快、容错强,需安装 C 语言库,是唯一支持 XML 的解析器。
    • html5lib:容错性最好,以浏览器方式解析,生成 HTML5 格式文档,速度慢且不依赖外部扩展。
    • 推荐使用 lxml 以提高效率。

安装与配置

  • 安装 BS4:可通过系统包管理(apt-get install Python-bs4)、PyPi(pip install beautifulsoup4easy_install beautifulsoup4)或源码(python setup.py install)安装。BS4 兼容 Python 2 和 Python 3。
  • 安装解析器:如 lxml(pip install lxml)或 html5lib(pip install html5lib)。
  • 常见问题:在 Python 3 中运行 Python 2 代码会报 No module named HTMLParser;反之报 No module named html.parser,需重新安装 BS4。

适用场景

  • 从网页或 XML 数据中提取所需信息(如链接、文本、特定标签内容)。
  • 对不规范或复杂的 HTML/XML 文档进行导航、查找与修改。
  • 编写爬虫、数据清洗或文档转换工具时,作为解析与提取数据的底层库。

寻求帮助

如有关于 BeautifulSoup 的问题,可发送邮件到讨论组。若问题包含需转换的 HTML 代码,应在描述中附带该 HTML 文档的代码诊断。