使用QWebPage刮取多个URL

import csv import re import sys from string import replace from bs4 import BeautifulSoup from PyQt4.QtGui import * from PyQt4.QtCore import * from PyQt4.QtWebKit import * class Item: __slots__ = ("name", "count", "price", "game") def __repr__(self): return self.name + "(" + str(self.count) + ")" def __str__(self): return self.name + ", " + str(self.count) + ", $" + str(self.price) class Render(QWebPage): def __init__(self, url): self.app = QApplication(sys.argv) QWebPage.__init__(self) self.loadFinished.connect(self._loadFinished) self.mainFrame().load(QUrl(url)) self.app.exec_() def _loadFinished(self, result): self.frame = self.mainFrame() self.app.quit() self.deleteLater() def getItemsFromPage(appid, page=1): r = Render("http://steamcommunity.com/market/search?q=appid:" + str(appid) + "#p" + str(page)) soup = BeautifulSoup(str(r.frame.toHtml().toUtf8())) itemLst = soup.find_all("div", "market_listing_row market_recent_listing_row") items = [] for k in itemLst: i = Item() i.name = k.find("span", "market_listing_item_name").string i.count = int(replace(k.find("span", "market_listing_num_listings_qty").string, ",", "")) i.price = float(re.search(r'\$([0-9]+\.[0-9]+)', str(k)).group(1)) i.game = appid items.append(i) return items if __name__ == "__main__": print "Updating market items to dota2.csv ..." i = 1 with open("dota2.csv", "w") as f: writer = csv.writer(f) r = None while True: print "Page " + str(i) items = getItemsFromPage(570) if len(items) == 0: print "No items found, stopping..." break for k in items: writer.writerow((k.name, k.count, k.price, k.game)) i += 1 print "Done."

1条回答

网友

1楼 · 发布于 2024-05-13 20:40:24

您的程序的问题是，您正试图用获取的每个url创建一个新的QApplication

相反，只应创建一个QApplication和一个网页。该网页可以使用其loadFinished信号创建一个内部循环，方法是在处理完每个url后获取一个新的url。自定义html处理可以通过将用户定义的插槽连接到一个信号来添加，该信号在html文本和url可用时发出。下面的脚本（用于PyQt5和PyQt4）展示了如何实现这一点

下面是一些演示如何使用WebPage类的示例：

用法：

def my_html_processor(html, url):
    print('loaded: [%d chars] %s' % (len(html), url))

import sys
app = QApplication(sys.argv)
webpage = WebPage(verbose=False)
webpage.htmlReady.connect(my_html_processor)

# example 1: process list of urls

urls = ['https://en.wikipedia.org/wiki/Special:Random'] * 3
print('Processing list of urls...')
webpage.process(urls)

# example 2: process one url continuously
#
# import signal, itertools
# signal.signal(signal.SIGINT, signal.SIG_DFL)
#
# print('Processing url continuously...')
# print('Press Ctrl+C to quit')
#
# url = 'https://en.wikipedia.org/wiki/Special:Random'
# webpage.process(itertools.repeat(url))

sys.exit(app.exec_())

PyQt5网页：

from PyQt5.QtCore import pyqtSignal, QUrl
from PyQt5.QtWidgets import QApplication
from PyQt5.QtWebEngineWidgets import QWebEnginePage

class WebPage(QWebEnginePage):
    htmlReady = pyqtSignal(str, str)

    def __init__(self, verbose=False):
        super().__init__()
        self._verbose = verbose
        self.loadFinished.connect(self.handleLoadFinished)

    def process(self, urls):
        self._urls = iter(urls)
        self.fetchNext()

    def fetchNext(self):
        try:
            url = next(self._urls)
        except StopIteration:
            return False
        else:
            self.load(QUrl(url))
        return True

    def processCurrentPage(self, html):
        self.htmlReady.emit(html, self.url().toString())
        if not self.fetchNext():
            QApplication.instance().quit()

    def handleLoadFinished(self):
        self.toHtml(self.processCurrentPage)

    def javaScriptConsoleMessage(self, *args, **kwargs):
        if self._verbose:
            super().javaScriptConsoleMessage(*args, **kwargs)

PyQt4网页：

from PyQt4.QtCore import pyqtSignal, QUrl
from PyQt4.QtGui import QApplication
from PyQt4.QtWebKit import QWebPage

class WebPage(QWebPage):
    htmlReady = pyqtSignal(str, str)

    def __init__(self, verbose=False):
        super(WebPage, self).__init__()
        self._verbose = verbose
        self.mainFrame().loadFinished.connect(self.handleLoadFinished)

    def start(self, urls):
        self._urls = iter(urls)
        self.fetchNext()

    def fetchNext(self):
        try:
            url = next(self._urls)
        except StopIteration:
            return False
        else:
            self.mainFrame().load(QUrl(url))
        return True

    def processCurrentPage(self):
        self.htmlReady.emit(
            self.mainFrame().toHtml(), self.mainFrame().url().toString())
        print('loaded: [%d bytes] %s' % (self.bytesReceived(), url))

    def handleLoadFinished(self):
        self.processCurrentPage()
        if not self.fetchNext():
            QApplication.instance().quit()

    def javaScriptConsoleMessage(self, *args, **kwargs):
        if self._verbose:
            super(WebPage, self).javaScriptConsoleMessage(*args, **kwargs)

相关问题更多 >

编程相关推荐

热门问题

热门文章