可以爬蟲小說排行榜的網站

發布時間: 2023-08-04 10:53:16

① 怎麼用python爬sf輕小說文庫的vip章節小說

你需要先購買vip，不然的話是爬不了的，除非系統有漏洞，記住爬蟲不是萬能的
步驟一：研究該網站
打開登錄頁面
進入以下頁面「」。你會看到如下圖所示的頁面（執行注銷，以防你已經登錄）

仔細研究那些我們需要提取的詳細信息，以供登錄之用
在這一部分，我們會創建一個字典來保存執行登錄的詳細信息：
1. 右擊「Username or email」欄位，選擇「查看元素」。我們將使用「name」屬性為「username」的輸入框的值。「username」將會是 key 值，我們的用戶名/電子郵箱就是對應的 value 值（在其他的網站上這些 key 值可能是「email」，「 user_name」，「 login」，等等）。

2. 右擊「Password」欄位，選擇「查看元素」。在腳本中我們需要使用「name」屬性為「password」的輸入框的值。「password」將是字典的 key 值，我們輸入的密碼將是對應的 value 值（在其他網站key值可能是「userpassword」，「loginpassword」，「pwd」，等等）。

3. 在源代碼頁面中，查找一個名為「csrfmiddlewaretoken」的隱藏輸入標簽。「csrfmiddlewaretoken」將是 key 值，而對應的 value 值將是這個隱藏的輸入值（在其他網站上這個 value 值可能是一個名為「csrftoken」，「 authenticationtoken」的隱藏輸入值）。列如：「」。

最後我們將會得到一個類似這樣的字典：

payload = {
"username": "<USER NAME>",
"password": "<PASSWORD>",
"csrfmiddlewaretoken": "<CSRF_TOKEN>"
}

請記住，這是這個網站的一個具體案例。雖然這個登錄表單很簡單，但其他網站可能需要我們檢查瀏覽器的請求日誌，並找到登錄步驟中應該使用的相關的 key 值和 value 值。
步驟2：執行登錄網站
對於這個腳本，我們只需要導入如下內容：

import requests
from lxml import html

首先，我們要創建 session 對象。這個對象會允許我們保存所有的登錄會話請求。

session_requests = requests.session()

第二，我們要從該網頁上提取在登錄時所使用的 csrf 標記。在這個例子中，我們使用的是 lxml 和 xpath 來提取，我們也可以使用正則表達式或者其他的一些方法來提取這些數據。

login_url = ""
result = session_requests.get(login_url)

tree = html.fromstring(result.text)
authenticity_token = list(set(tree.xpath("//input[@name='csrfmiddlewaretoken']/@value")))[0]

**更多關於xpath 和lxml的信息可以在這里找到。
接下來，我們要執行登錄階段。在這一階段，我們發送一個 POST 請求給登錄的 url。我們使用前面步驟中創建的 payload 作為 data 。也可以為該請求使用一個標題並在該標題中給這個相同的 url 添加一個參照鍵。

result = session_requests.post(
login_url,
data = payload,
headers = dict(referer=login_url)
)

步驟三：爬取內容
現在，我們已經登錄成功了，我們將從 bitbucket dashboard 頁面上執行真正的爬取操作。

url = ''
result = session_requests.get(
url,
headers = dict(referer = url)
)

為了測試以上內容，我們從 bitbucket dashboard 頁面上爬取了項目列表。我們將再次使用 xpath 來查找目標元素，清除新行中的文本和空格並列印出結果。如果一切都運行 OK，輸出結果應該是你 bitbucket 賬戶中的 buckets / project 列表。

Python

1
2
3
4
5

tree = html.fromstring(result.content)
bucket_elems = tree.findall(".//span[@class='repo-name']/")
bucket_names = [bucket.text_content.replace("n", "").strip() for bucket in bucket_elems]

print bucket_names

你也可以通過檢查從每個請求返回的狀態代碼來驗證這些請求結果。它不會總是能讓你知道登錄階段是否是成功的，但是可以用來作為一個驗證指標。
例如：

Python

1
2

result.ok # 會告訴我們最後一次請求是否成功
result.status_code # 會返回給我們最後一次請求的狀態

就是這樣。

② Python爬取筆趣閣小說返回的網頁內容中沒有小說內容

思路：
一、分析網頁，網址架構
二、碼代碼並測試
三、下載並用手機打開觀察結果
一、分析網頁，網址架構
先隨便點擊首頁上的一篇小說，土豆的--元尊，發現在首頁上面有如下一些信息：作者，狀態，最新章節，最後更新時間，簡介，以及下面就是每一章的章節名，點擊章節名就可以跳轉到具體的章節。
然後我們按F12，進入開發者模式，在作者上面點擊右鍵--「檢查」，可以發現這些信息都是比較正常地顯示。
再看章節名稱，發現所有的章節都在<div id="list"> 下面的 dd 裡面，整整齊齊地排列好了，看到這種情形，就像點個贊，爬起來舒服。
分析完首頁，點擊章節名稱，跳轉到具體內容，發現所有的正文都在 <div id="content"> 下面，巴適的很
那麼現在思路就是，先進入小說首頁，爬取小說相關信息，然後遍歷章節，獲取章節的鏈接，之後就是進入具體章節，下載小說內容。
OK，開始碼代碼。
二、碼代碼並測試
導入一些基本的模塊：
import requests
from bs4 import BeautifulSoup
import random
2.先構建第一個函數，用於打開網頁鏈接並獲取內容。
使用的是requests 包的request.get ，獲取內容之後用『utf-8』進行轉碼。
這里我之前有個誤區就是，以為所有的網站都是用 'utf-8' 進行轉碼的，但是實際上有些是用'gbk' 轉碼的，如果隨便寫，就會報錯。
網路之後，只要在console 下面輸入『document.charset』就可以獲取網站的編碼方式。

熱點內容

小說念武記最新章節發布：2023-08-31 22:07:07 瀏覽：107

求系統類小說發布：2023-08-31 22:04:10 瀏覽：291

開火箭的小說短篇發布：2023-08-31 22:02:08 瀏覽：96

女主角叫沈瑾年的小說發布：2023-08-31 22:01:11 瀏覽：932

有聲小說仙妻有喜爆軍蛇王燎上癮發布：2023-08-31 21:52:57 瀏覽：793

小說古龍武俠書發布：2023-08-31 21:52:07 瀏覽：713

賈平凹有聲小說藏地密碼發布：2023-08-31 21:48:34 瀏覽：31

女主叫家人全名玄幻小說發布：2023-08-31 21:44:18 瀏覽：755

重生洛天小說發布：2023-08-31 21:37:22 瀏覽：420

玄幻小說里的法力是什麼發布：2023-08-31 21:30:05 瀏覽：162

可以爬蟲小說排行榜的網站

與可以爬蟲小說排行榜的網站相關的資訊