Grundlegendes zu diesem Pandas-Skript

Question

Nov 03, 2013, 12:15 AM

Grundlegendes zu diesem Pandas-Skript

Ich habe diesen Code erhalten, um Daten in Daten vom Typ Histogramm zu gruppieren. Ich habe versucht, den Code in diesem Pandas-Skript zu verstehen, um ihn zu bearbeiten, zu manipulieren und zu duplizieren. Ich habe Kommentare zu den Abschnitten, die ich verstehe.

Code

import numpy as np
import pandas as pd


column_names = ['col1', 'col2', 'col3', 'col4', 'col5', 'col6', 
              'col7', 'col8', 'col9', 'col10', 'col11'] #names to be used as column labels.  If no names are specified then columns can be refereed to by number eg. df[0], df[1] etc.

df = pd.read_csv('data.csv', header=None, names=column_names) #header= None means there are no column headings in the  csv file

df.ix[df.col11 == 'x', 'col11']=-0.08 #trick so that 'x' rows will be grouped into a category >-0.1 and <= -0.05.  This will allow all of col11 to be treated as a numbers

bins = np.arange(-0.1, 1.0, 0.05) #bins to put col11 values in.  >-0.1 and <=-0.05 will be our special 'x' rows, >-0.05 and <=0 will capture all the '0' values.
labels = np.array(['%s:%s' % (x, y) for x, y in zip(bins[:-1], bins[1:])]) #create labels for the bins
labels[0] = 'x' #change first bin label to 'x'
labels[1] = '0' #change second bin label to '0'

df['col11'] = df['col11'].astype(float) #convert col11 to numbers so we can do math on them


df['bin'] = pd.cut(df['col11'], bins=bins, labels=False) # make another column 'bins' and put in an integer representing what bin the number falls into.Later we'll map the integer to the bin label


df.set_index('bin', inplace=True, drop=False, append=False) #groupby is meant to run faster with an index

def count_ones(x):
    """aggregate function to count values that equal 1"""
    return np.sum(x==1)

dfg = df[['bin','col7','col11']].groupby('bin').agg({'col11': [np.mean], 'col7': [count_ones, len]})
dfg.index = labels[dfg.index]

dfg.ix['x',('col11', 'mean')]='N/A'
print(dfg)
dfg.to_csv('new.csv')

Der Abschnitt, den ich nur schwer verstehen kann, befindet sich in diesem Abschnitt:

def count_ones(x):
    """aggregate function to count values that equal 1"""
    return np.sum(x==1)

dfg = df[['bin','col7','col11']].groupby('bin').agg({'col11': [np.mean], 'col7': [count_ones, len]})
dfg.index = labels[dfg.index]

dfg.ix['x',('col11', 'mean')]='N/A'
print(dfg)
dfg.to_csv('new.csv')

Wenn jemand in der Lage ist, dieses Skript zu kommentieren, wäre ich sehr dankbar. Fühlen Sie sich auch frei, meine Kommentare zu korrigieren oder zu ergänzen (ich gehe davon aus, dass sie möglicherweise nicht korrekt sind). Ich hoffe, dass dies für SOF nicht zu ungewöhnlich ist. Ich werde jedem Benutzer, der mir dabei helfen kann, gerne ein Kopfgeld von 50 Punkten gewähren.