Python中的相關分析correlation analysis的實現

系統 2019-09-27 17:56:53 2365 0

相關分析（correlation analysis）

研究兩個或兩個以上隨機變量之間相互依存關系的方向和密切程度的方法。
線性相關關系主要采用皮爾遜（Pearson）相關系數r來度量連續變量之間線性相關強度；
r>0,線性正相關；r<0,線性負相關；
r=0,兩個變量之間不存在線性關系，并不代表兩個變量之間不存在任何關系。

相關分析函數
DataFrame.corr()
Series.corr(other)

函數說明：
如果由數據框調用corr函數，那么將會計算每個列兩兩之間的相似度
如果由序列調用corr方法，那么只是該序列與傳入的序列之間的相關度

返回值：
DataFrame調用；返回DataFrame

Series調用：返回一個數值型，大小為相關度

            
import numpy
import pandas
 
data = pandas.read_csv(
  'C:/Users/ZL/Desktop/Python/5.4/data.csv'
)
 
bins = [
  min(data.年齡)-1, 20, 30, 40, max(data.年齡)+1
]
labels = [
  '20歲以及以下', '21歲到30歲', '31歲到40歲', '41歲以上'
]
 
data['年齡分層'] = pandas.cut(
  data.年齡, 
  bins, 
  labels=labels
)
 
ptResult = data.pivot_table(
  values=['年齡'], 
  index=['年齡分層'], 
  columns=['性別'], 
  aggfunc=[numpy.size]
 File "
            
              ", line 25
  aggfunc=[numpy.size]
            ^
SyntaxError: unexpected EOF while parsing
 
 
import numpy
import pandas
 
data = pandas.read_csv(
  'C:/Users/ZL/Desktop/Python/5.4/data.csv'
)
 
bins = [
  min(data.年齡)-1, 20, 30, 40, max(data.年齡)+1
]
labels = [
  '20歲以及以下', '21歲到30歲', '31歲到40歲', '41歲以上'
]
 
data['年齡分層'] = pandas.cut(
  data.年齡, 
  bins, 
  labels=labels
)
 
ptResult = data.pivot_table(
  values=['年齡'], 
  index=['年齡分層'], 
  columns=['性別'], 
  aggfunc=[numpy.size]
)
 
ptResult
Out[4]: 
     size    
      年齡    
性別     女   男
年齡分層        
20歲以及以下  111  1950
21歲到30歲 2903 43955
31歲到40歲  735  7994
41歲以上   567  886

以上就是本文的全部內容，希望對大家的學習有所幫助，也希望大家多多支持腳本之家。

更多文章、技術交流、商務合作、聯系博主

微信掃碼或搜索：z360901061

微信掃一掃加我為好友

QQ號聯系： 360901061

您的支持是博主寫作最大的動力，如果您喜歡我的文章，感覺我的文章對您有幫助，請用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧，狠狠點擊下面給點支持吧，站長非常感激您！手機微信長按不能支付解決辦法：請將微信支付二維碼保存到相冊，切換到微信，然后點擊微信右上角掃一掃功能，選擇支付二維碼完成支付。

【本文對您有幫助就好】元

2元

5元

10元

20元

自定義

發表我的評論

最新評論總共0條評論