我需要将整个html源代码保存到一个文件中,以便稍后进行解析。
在这里,我似乎遗漏了一些显而易见的东西,但是代码应该是获取页面源代码并将其保存到文本文件中。它所做的就是创建一个空文件。如果我写了一个静态字符串,它就会被保存。所以我怀疑这是因为,page_source正在成为空白。
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import time
# imported keys tp try Enter key simualtion.
driver = webdriver.Firefox()
#driver.set_window_size(2000, 1500)
driver.get("http://www.moneycontrol.com")
searchText = driver.find_element_by_id("search_str")
searchText.send_keys("dlf")
search_button = driver.find_element_by_css_selector(".btn_black.btn_search.FR")
search_button.click()
time.sleep(3)# i know this isn't the right way to wait.
StrSource = driver.page_source
textfile = open('test1.txt', 'w')
textfile.write(StrSource)
textfile.close()发布于 2017-11-29 10:19:14
添加一个隐式等待,以便允许驱动程序等待所有页面元素完全加载。
driver = webdriver.Firefox()
driver.implicitly_wait(10)如果这不起作用,那么为目标页面上的任何元素添加一个显式等待。添加断言以检查目标页是否已完全加载。然后开始将页面源抓取到文本文件。
发布于 2017-11-29 11:51:13
我有你自己的剧本。在我们到达底线之前,控制流是非常好的:
textfile.write(StrSource)在试图写入Selenium-Python客户端时,test1.txt客户端显示的错误如下:
return codecs.charmap_encode(input,self.errors,encoding_table)[0]
UnicodeEncodeError: 'charmap' codec can't encode characters in position 57354-57358: character maps to <undefined>这是Selenium-Python客户端v3.7.0中的一个已知问题,我们期待早日修复。
https://stackoverflow.com/questions/47548870
复制相似问题