from sklearn.cluster import KMeans from sklearn.decomposition import PCA import numpy as np from load import load def select_features(data): columns = list(filter(lambda column: 'UNITS' in column, data.columns)) columns.remove('TOTAL_UNITS') array = data.as_matrix(columns) return np.nan_to_num(array) if __name__ == "__main__": data = load() X = select_features(data) pca = PCA(n_components=2).fit(X) print(pca.explained_variance_ratio_) print(pca.explained_variance_) projection = pca.transform(X) np.savetxt("results.csv", projection, delimiter=",") exit() ''' kmeans = KMeans().fit(X) for label in kmeans.labels_: print(label) '''