笨鸟编程-零基础入门Pyhton教程 › 首页 ›Beautiful Soup 4 手册 › 查看内容

编码

2022-2-21 07:38| 发布者: 笨鸟自学网| 查看: 6519| 评论: 0

摘要: 任何HTML或XML文档都有自己的编码方式,比如ASCII 或 UTF-8,但是使用Beautiful Soup解析后,文档都被转换成了Unicode:markup = "h1Sacr\xc3\xa9 bleu!/h1" soup = BeautifulSoup(markup) soup.h1 # h1Sacré bleu!/h1 ...

Unicode, Dammit! (乱码, 靠!)

译者备注: UnicodeDammit 是BS内置库, 主要用来猜测文档编码.

编码自动检测功能可以在Beautiful Soup以外使用,检测某段未知编码时,可以使用这个方法:

from bs4 import UnicodeDammit
dammit = UnicodeDammit("Sacr\xc3\xa9 bleu!")
print(dammit.unicode_markup)
# Sacré bleu!
dammit.original_encoding
# 'utf-8'

如果Python中安装了 chardet 或 cchardet 那么编码检测功能的准确率将大大提高. 输入的字符越多,检测结果越精确,如果事先猜测到一些可能编码, 那么可以将猜测的编码作为参数,这样将优先检测这些编码:

dammit = UnicodeDammit("Sacr\xe9 bleu!", ["latin-1", "iso-8859-1"])
print(dammit.unicode_markup)
# Sacré bleu!
dammit.original_encoding
# 'latin-1'

编码自动检测功能中有2项功能是Beautiful Soup库中用不到的

1 23 / 3 页

收藏分享邀请

上一篇：指定文档解析器下一篇：智能引号

		自动登录	找回密码
密码			立即注册

编码

Unicode, Dammit! (乱码, 靠!)

相关分类