import os environment = os.environ.get('Environment', 'dev') # spark variables spark_master = os.environ.get('SPARK_MASTER_URL') spark_app = 'spark_tester' spark_s3_temp_dir = 's3n://dev-cucumbers/YouTubeMonthly/spark/' # aws creds aws_access_key = os.environ.get('AWS_ACCESS_KEY_ID') aws_secret_key = os.environ.get('AWS_SECRET_ACCESS_KEY') # redshift source 1 redshift_url_1 = 'jdbc:redshift://{HOST}:{PORT}/{DB}?user={USER}&password={PASS}'.format( HOST=os.environ.get('REDSHIFT_READ_WRITE_HOST'), PORT=os.environ.get('REDSHIFT_READ_WRITE_PORT'), DB=os.environ.get('REDSHIFT_READ_WRITE_DB'), USER=os.environ.get('REDSHIFT_READ_WRITE_USER'), PASS=os.environ.get('REDSHIFT_READ_WRITE_PASSWORD')) ################### # tables to analyze ################### tables = ['lory_test', 'lory_test_another'] lory_test = { 'source': redshift_url_1, 'query': 'SELECT video_id, custom_id, extracted_upc, extracted_upc_long from lory_test', 'columns': { 'video_id': 'string', 'custom_id': 'string', 'extracted_upc': 'string', 'extracted_upc_long': 'integer' } } lory_test_another = { 'source': redshift_url_1, 'query': 'SELECT video_id, custom_id, extracted_upc, extracted_upc_long from lory_test_another', 'columns': { 'video_id': 'string', 'custom_id': 'string', 'extracted_upc': 'string', 'extracted_upc_long': 'integer' } } ################## # tests to perform ################## tests = ['test_aggregate'] test_comparison = { 'tables': ['lory_test', 'lory_test_another'], 'columns': ['video_id'] } test_aggregate = { 'tables': ['lory_test', 'lory_test_another'], 'columns': ['extracted_upc_long'] }