import pandas as pd
import numpy as np
from plotnine import *
import statsmodels.api as sm
from sklearn.model_selection import train_test_split
from statsmodels.sandbox.regression.predstd import wls_prediction_std
from plotnine import *
import plotnine.options
plotnine.options.figure_size = (16,8)
import warnings
warnings.simplefilter(action='ignore', category=FutureWarning)
pd.set_option('display.max_columns', None)
sp = pd.read_feather('../data/archive_as_of_friday_20_july/streams_post_day_5_pop.feather')
sp.head()
ggplot(sp, aes('pop_5', 'log_cum_sum_after_pop_5')) + geom_point() + geom_point(aes('pop_5', 'log_all_streams_cumsum'), color = "red") + ggtitle('Streams [0,100] in Red, Streams [6,100] in black vs Pop 5')
ggplot(sp, aes('log_cum_sum_5', 'log_cum_sum_after_pop_5')) + geom_point() + geom_abline(slope=1) + ggtitle('Streams[6,100] vs Streams[0,5]')
ggplot(sp, aes('pop_5','fraction_of_stream_pre_5')) + geom_point()
model = sm.OLS(sp['log_cum_sum_after_pop_5'], sm.add_constant(sp['pop_5']))
results = model.fit()
results.summary()
streams_1_100 = pd.read_feather('../data/archive_as_of_friday_20_july/streams_1_100.feather')
streams_1_100.head()
(ggplot(streams_1_100, aes('cumsum_day_1', 'cumsum_2to100')) +
geom_point() +
scale_x_log10() +
scale_y_log10())
(ggplot(streams_1_100, aes('cumsum_day_1', 'cumsum_2to100')) +
geom_point() +
scale_x_log10() +
scale_y_log10() + coord_cartesian(xlim=[1, 1e7], ylim=[1,1e7]))
model = sm.OLS(np.log(streams_1_100['cumsum_2to100']), sm.add_constant(np.log(streams_1_100['cumsum_day_1'])))
results = model.fit()
results.summary()