读数据 读数据前,要考虑两个方面:数据的外观(对外呈现给我们的样子)和内在(具体存放的位置)。具体来说,要考虑: 表头 schema 存储格式(尽量用 parquet,列式存储,压缩性能,读取快) 数据量 df = spark . read . csv( "s3://mybucket/large_dataset.csv" , header = True , inferSchema = True )…
读数据 读数据前,要考虑两个方面:数据的外观(对外呈现给我们的样子)和内在(具体存放的位置)。具体来说,要考虑: 表头 schema 存储格式(尽量用 parquet,列式存储,压缩性能,读取快) 数据量 df = spark . read . csv( "s3://mybucket/large_dataset.csv" , header = True , inferSchema = True )…
讨论
登录后参与讨论
还没有评论,来说第一句吧。