腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
让
BeautifulSoup
正确
解析
php
标签
或
忽略
它们
php
、
python
、
parsing
、
beautifulsoup
、
html-parsing
我目前需要
解析
大量的.phtml文件,获取特定的html
标签
,并为其添加自定义数据属性。我正在使用python美观汤来
解析
整个文档并添加
标签
,这一部分工作得很好。问题是在视图文件(phtml)上也有被
解析
的
标签
。以下是输入-输出的示例 输入 <?
php
$stars = $this-> getData
浏览 27
提问于2019-04-24
得票数 0
1
回答
不含内标及特殊
标签
,配以美汤
python
、
html
、
web-scraping
、
beautifulsoup
我正试图
解析
看起来像<div><li><label>Tournament Name</label>TCG Saturday</li>for lis in soup.find_all('li'):但这也会导致阅读
标签<
浏览 1
提问于2018-04-12
得票数 1
回答已采纳
5
回答
使用
BeautifulSoup
解析
文档,而不
解析
<code>标记的内容
python
、
html
、
django
、
beautifulsoup
、
pygments
我想允许评论作者使用一些
标签
(如<strong>,a等),但禁用所有其他
标签
。#include <stdio.h> {}问题是,当我使用
BeautifulSoup
浏览 0
提问于2010-10-24
得票数 10
1
回答
BeautifulSoup
'AttributeError‘
python
、
beautifulsoup
from
BeautifulSoup
import
BeautifulSoup
print ((
BeautifulSoup
(((urlopen(url
浏览 0
提问于2012-05-16
得票数 1
回答已采纳
1
回答
一个简单的问题:切换到静态html模式并返回,或者在不同的平台上停留在执行模式。
php
在没有条件语句的情况下,考虑命名变量x、y和z,
它们
被定义为基本的字符串变量--从查询
或
诸如此类的东西中提取。在
PHP
文件中,在网页中读回这样的内容可能如下所示: <?
php
$y= blah, blah, blah; echo "<p>$x</p>/n<p>$y</p>/n</
php
echo $
浏览 6
提问于2021-04-02
得票数 0
3
回答
浏览器如何处理格式错误的HTML?
html
、
parsing
、
browser
我有一个要
解析
的文档集合。与HTML一样,
它们
的结构也相当好,语法/语法也很复杂。同样像HTML一样,许多文档并不完全遵循所需的语法。我的问题是,在
解析
不严格遵循
正确
语法的文档时,浏览器和HTML/XML
解析
库使用哪些常规策略?
它们
似乎很好地处理了放错位置
或
丢失的
标签
。我确信还有其他的情况,比如拼写错误的
标签
,不
正确
的属性等,这些都必须处理,而不是简单地
忽略
。
浏览 1
提问于2011-12-03
得票数 1
回答已采纳
3
回答
使
BeautifulSoup
忽略
脚本标记内的内容
python
、
beautifulsoup
、
html-parsing
我一直在尝试
让
BeautifulSoup
(3.1.0.1)
解析
一个html页面,该页面包含大量的javascript,可以在
标签
内生成html。document.getElementById("flatMenuItemAnchor" + selectedPageId), selectedPageId);</script></html>
BeautifulSoup
它似乎试图
解析
由
浏览 3
提问于2009-11-14
得票数 1
3
回答
从HTML中提取数据
python
、
regex
、
scrape
我正在尝试抓取一个网站。我已经能够将网站上的内容放到一个字符串/文件中。<li><span class="abc">Key 1:</span> <span class="aom_pb">Value 1</span></li>致敬,AMM
浏览 1
提问于2011-11-06
得票数 1
1
回答
BeautifulSoup
4美化输出XHTML,而不是HTML
python
、
html
、
beautifulsoup
我正在尝试
解析
和美化一堆用微软FrontPage制作的文件。
Beautifulsoup
解析
它们
没有任何问题,但是当我尝试用prettify()打印输出时,像<meta>
或
<br>这样的
标签
被重写为<meta ... />和<br/>。
浏览 2
提问于2012-11-19
得票数 3
回答已采纳
1
回答
BeautifulSoup
和
php
/html文件
php
、
python
、
html
、
parsing
、
beautifulsoup
我一直在使用
BeautifulSoup
将一些古老的HTML文件中的相对URL从一个归档站点转换为绝对URL(主要是为了
让
.htaccess规则更好地针对
它们
)。他们大多使用3-5行来包含其他.
php
文件,其余的都是HTML,不过也有一些例外。
浏览 2
提问于2017-01-12
得票数 4
回答已采纳
3
回答
在HTML文件中查找所有*呈现的*图像
python
、
html
、
regex
、
parsing
我需要一种方法,在片段中只找到呈现的IMG标记。所以,我不能仅仅用HTML片段来查找所有的IMG标记,因为我还会得到在HTML中显示为文本的IMG标记(而不是呈现的)。有什么想法吗?
浏览 2
提问于2009-04-07
得票数 0
回答已采纳
2
回答
在
BeautifulSoup
中选择具有多部件类的标记
python
、
beautifulsoup
我试图从一个网页上刮掉一些数据,这个网页上有多个部件
标签
的div
标签
。例如<div class="A">,<div class="A B">和<div class="A X Y">。我想收集前两种类型的
标签
,但不是最后一种。我认为使用
BeautifulSoup
很简单:import re url_
浏览 3
提问于2016-02-17
得票数 1
回答已采纳
2
回答
BeautifulSoup
:从html获取css类
python
、
html
、
css
、
beautifulsoup
有没有办法使用
BeautifulSoup
从HTML文件中获取CSS类?
浏览 0
提问于2012-07-16
得票数 8
回答已采纳
2
回答
递归BBCode
解析
php
、
regex
、
bbcode
我正在尝试
解析
脚本中的BBCode。现在,它可以无缝地工作了,直到我尝试缩进BBCode,而不仅仅是粗体
或
下划线,比如扰流,url,字体大小等等,它就搞砸了。
浏览 2
提问于2011-07-21
得票数 2
回答已采纳
4
回答
如何使用
BeautifulSoup
从HTML中剥离注释标记?
python
、
beautifulsoup
我一直在玩
BeautifulSoup
,这很棒。我的最终目标是尝试从页面中获取文本。我只是尝试从正文中获取文本,并使用一个特殊情况从<a>
或
<img>标记中获取标题和/
或
alt属性。到目前为止,我有这个EDITED & UPDATED CURRENT CODEcomments = soup.findAll(text=lambdasoup.findAll(text=True)) page = ' '.join(
浏览 0
提问于2010-08-18
得票数 16
回答已采纳
2
回答
如何用
BeautifulSoup
解析
HTML
标签
中的HTML
标签
内容?
python
、
html
、
parsing
、
beautifulsoup
在web上发现的html的唯一情况下,存在在父html
标签
内具有多个html
标签
的HTML文档。我想
解析
html标记的内容。谁能给我指出这样做的方向?soup =
BeautifulSoup
(html, "lxml") 仅提供父html和其中存在的标记。然而,我假设如果浏览器能够呈现html,那么BS应该能够
解析
它。这个假设是
正确
的吗?编辑2:实际上html是一个格式错误的html (我假设是在这里
浏览 0
提问于2017-06-05
得票数 0
1
回答
解析
源代码(Python)方法:漂亮的汤,lxml,html5lib的区别?
python
、
parsing
、
beautifulsoup
、
lxml
我有一个很大的HTML源代码,我想要
解析
(大约200,000)行,并且我相当确定在整个过程中都有一些糟糕的格式。我一直在研究一些
解析
器,似乎Beautiful Soup,lxml,html5lib是最受欢迎的。我对Beautiful Soup文档、和像
BeautifulSoup
(markup,"lxml")
或
BeautifulSoup
(markup,html5lib)这样的命令感到有点困惑。最终目标是使用urllib2
解析
获取源代码,并从文件中检索所有文本数据,就像我
浏览 0
提问于2012-06-08
得票数 1
1
回答
使用“另存为”下载的HTML与使用Python请求下载的HTML略有不同
python
、
html
、
python-requests
、
urllib
page_content.html', 'w') as fid:fid.close() 并注意到我想要webscrape (表格)的相关部分是相同的,直到几个未闭合的
标签
“另存为html”页具有
正确
的结束标记,但“请求”页缺少某些标记的结尾。,当我使用Inspect时,所有
标签
都是关闭的。但是当我使用View Page Source时,我看到了缺少的
标签
。当在Chrome中打开时,Requests-downloaded页面显示
正确
浏览 0
提问于2019-05-13
得票数 0
3
回答
DOMDocument中加载的模板中的
PHP
代码块
php
、
domdocument
、
libxml2
我需要用DOMDocument
解析
HTML。但是HTML代码可能包含
PHP
代码块,例如: <div id="test" data="<?
php
echo $somevar?
解析
器认为"data“属性没有右引号,<
php
是新标记。我如何指定
忽略
<
php
标签
或
类似的东西?
浏览 2
提问于2011-12-25
得票数 3
回答已采纳
1
回答
使用Python以编程方式将DOCX转换为HTML
python
、
python-docx
我已经在Python中实现了HTML to DOCX,在那里我使用
BeautifulSoup
解析
了HTML。我递归地遍历了每个HTML
标签
,然后使用Python-Docx库创建了Docx文档。但是,我找不到一种方法来遍历每个文档对象并将
它们
转换为HTML字符串。 有没有办法可以做这样的反向
解析
?我尝试过和库。然而,我发现他们
忽略
了一些样式,我想自己写代码,而不是使用库。
浏览 3
提问于2019-09-06
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券