成人午夜视频全免费观看高清-秋霞福利视频一区二区三区-国产精品久久久久电影小说-亚洲不卡区三一区三区一区

怎么用Python來分析紅樓夢里的人物關(guān)系-創(chuàng)新互聯(lián)

這篇文章主要介紹了怎么用Python來分析紅樓夢里的人物關(guān)系,具有一定借鑒價值,感興趣的朋友可以參考下,希望大家閱讀完這篇文章之后大有收獲,下面讓小編帶著大家一起了解一下。

創(chuàng)新互聯(lián)服務(wù)項目包括興慶網(wǎng)站建設(shè)、興慶網(wǎng)站制作、興慶網(wǎng)頁制作以及興慶網(wǎng)絡(luò)營銷策劃等。多年來,我們專注于互聯(lián)網(wǎng)行業(yè),利用自身積累的技術(shù)優(yōu)勢、行業(yè)經(jīng)驗、深度合作伙伴關(guān)系等,向廣大中小型企業(yè)、政府機(jī)構(gòu)等提供互聯(lián)網(wǎng)行業(yè)的解決方案,興慶網(wǎng)站推廣取得了明顯的社會效益與經(jīng)濟(jì)效益。目前,我們服務(wù)的客戶以成都為中心已經(jīng)輻射到興慶省份的部分城市,未來相信會繼續(xù)擴(kuò)大服務(wù)區(qū)域并繼續(xù)獲得客戶的支持與信任!

數(shù)據(jù)準(zhǔn)備

紅樓夢 TXT 文件一份

金陵十二釵 + 賈寶玉 人物名稱列表

人物列表內(nèi)容如下:

寶玉 nr
黛玉 nr
寶釵 nr
湘云 nr
鳳姐 nr
李紈 nr
元春 nr
迎春 nr
探春 nr
惜春 nr
妙玉 nr
巧姐 nr
秦氏 nr

這份列表,同時也是為了做分詞時使用,后面的 nr 就是人名的意思。

數(shù)據(jù)處理

讀取數(shù)據(jù)并加載詞典

  with open("紅樓夢.txt", encoding='gb18030') as f:
    honglou = f.readlines()
  jieba.load_userdict("renwu_forcut")
  renwu_data = pd.read_csv("renwu_forcut", header=-1)
  mylist = [k[0].split(" ")[0] for k in renwu_data.values.tolist()]

這樣,我們就把紅樓夢讀取到了 honglou 這個變量當(dāng)中,同時也通過 load_userdict 將我們自定義的詞典加載到了 jieba 庫中。

對文本進(jìn)行分詞處理并提取

tmpNames = []
  names = {}
  relationships = {}
  for h in honglou:
    h.replace("賈妃", "元春")
    h.replace("李宮裁", "李紈")
    poss = pseg.cut(h)
    tmpNames.append([])
    for w in poss:
      if w.flag != 'nr' or len(w.word) != 2 or w.word not in mylist:
        continue
      tmpNames[-1].append(w.word)
      if names.get(w.word) is None:
        names[w.word] = 0
      relationships[w.word] = {}
      names[w.word] += 1
  • 首先,因為文中"賈妃", "元春","李宮裁", "李紈" 混用嚴(yán)重,所以這里直接做替換處理。

  • 然后使用 jieba 庫提供的 pseg 工具來做分詞處理,會返回每個分詞的詞性。

  • 之后做判斷,只有符合要求且在我們提供的字典列表里的分詞,才會保留。

  • 一個人每出現(xiàn)一次,就會增加一,方便后面畫關(guān)系圖時,人物 node 大小的確定。

  • 對于存在于我們自定義詞典的人名,保存到一個臨時變量當(dāng)中 tmpNames。

處理人物關(guān)系

  for name in tmpNames:
    for name1 in name:
      for name2 in name:
        if name1 == name2:
          continue
        if relationships[name1].get(name2) is None:
          relationships[name1][name2] = 1
        else:
          relationships[name1][name2] += 1

對于出現(xiàn)在同一個段落中的人物,我們認(rèn)為他們是關(guān)系緊密的,每同時出現(xiàn)一次,關(guān)系增加1.

保存到文件

  with open("relationship.csv", "w", encoding='utf-8') as f:
    f.write("Source,Target,Weight\n")
    for name, edges in relationships.items():
      for v, w in edges.items():
        f.write(name + "," + v + "," + str(w) + "\n")

  with open("NameNode.csv", "w", encoding='utf-8') as f:
    f.write("ID,Label,Weight\n")
    for name, times in names.items():
      f.write(name + "," + name + "," + str(times) + "\n")
  • 文件1:人物關(guān)系表,包含首先出現(xiàn)的人物、之后出現(xiàn)的人物和一同出現(xiàn)次數(shù)

  • 文件2:人物比重表,包含該人物總體出現(xiàn)次數(shù),出現(xiàn)次數(shù)越多,認(rèn)為所占比重越大。

制作關(guān)系圖表

使用 pyecharts 作圖

def deal_graph():
  relationship_data = pd.read_csv('relationship.csv')
  namenode_data = pd.read_csv('NameNode.csv')
  relationship_data_list = relationship_data.values.tolist()
  namenode_data_list = namenode_data.values.tolist()

  nodes = []
  for node in namenode_data_list:
    if node[0] == "寶玉":
      node[2] = node[2]/3
    nodes.append({"name": node[0], "symbolSize": node[2]/30})
  links = []
  for link in relationship_data_list:
    links.append({"source": link[0], "target": link[1], "value": link[2]})

  g = (
    Graph()
    .add("", nodes, links, repulsion=8000)
    .set_global_opts(title_opts=opts.TitleOpts(title="紅樓人物關(guān)系"))
  )
  return g

首先把兩個文件讀取成列表形式

對于“寶玉”,由于其占比過大,如果統(tǒng)一進(jìn)行縮放,會導(dǎo)致其他人物的 node 過小,展示不美觀,所以這里先做了一次縮放

最后得出的關(guān)系圖

怎么用Python來分析紅樓夢里的人物關(guān)系

所有代碼已經(jīng)上傳至 Github

最后,我還準(zhǔn)備了一份更加全面的紅樓人物字典,可以在代碼倉庫中找到-“renwu_total”,感興趣的小伙伴也可以嘗試下,制作一個全人物的關(guān)系圖。

感謝你能夠認(rèn)真閱讀完這篇文章,希望小編分享的“怎么用Python來分析紅樓夢里的人物關(guān)系”這篇文章對大家有幫助,同時也希望大家多多支持創(chuàng)新互聯(lián)成都網(wǎng)站設(shè)計公司,關(guān)注創(chuàng)新互聯(lián)成都網(wǎng)站設(shè)計公司行業(yè)資訊頻道,更多相關(guān)知識等著你來學(xué)習(xí)!

另外有需要云服務(wù)器可以了解下創(chuàng)新互聯(lián)scvps.cn,海內(nèi)外云服務(wù)器15元起步,三天無理由+7*72小時售后在線,公司持有idc許可證,提供“云服務(wù)器、裸金屬服務(wù)器、網(wǎng)站設(shè)計器、香港服務(wù)器、美國服務(wù)器、虛擬主機(jī)、免備案服務(wù)器”等云主機(jī)租用服務(wù)以及企業(yè)上云的綜合解決方案,具有“安全穩(wěn)定、簡單易用、服務(wù)可用性高、性價比高”等特點與優(yōu)勢,專為企業(yè)上云打造定制,能夠滿足用戶豐富、多元化的應(yīng)用場景需求。

分享文章:怎么用Python來分析紅樓夢里的人物關(guān)系-創(chuàng)新互聯(lián)
新聞來源:http://jinyejixie.com/article16/cescdg.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供關(guān)鍵詞優(yōu)化、微信小程序App設(shè)計、企業(yè)網(wǎng)站制作網(wǎng)站排名、小程序開發(fā)

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)

綿陽服務(wù)器托管
玉溪市| 安达市| 金川县| 双桥区| 临城县| 三穗县| 会宁县| 顺义区| 太和县| 榆林市| 石屏县| 高唐县| 拉孜县| 普格县| 姜堰市| 称多县| 清流县| 荔波县| 厦门市| 南丹县| 宁河县| 铜鼓县| 玉溪市| 乌兰县| 蒲城县| 浦东新区| 泸定县| 万全县| 巴林右旗| 五河县| 宿松县| 庐江县| 界首市| 石楼县| 双辽市| 台南市| 盐津县| 谷城县| 海淀区| 凭祥市| 军事|