emrpy.data

emrpy.data.load_csv(file_path, engine='polars', lazy=False, sample_n=None, **kwargs)

Load a CSV file using pandas or Polars, with optional row-count sampling.

Return type:

Union[DataFrame, DataFrame, LazyFrame]

Parameters:

file_pathstr or Path

Path to the CSV file.

engine{‘pandas’, ‘polars’}, default ‘polars’

Which backend to use: - ‘pandas’: calls pd.read_csv - ‘polars’: calls pl.read_csv (eager) or pl.scan_csv (lazy)

lazybool, default False

If True and engine=’polars’, returns a pl.LazyFrame via pl.scan_csv. Ignored when engine=’pandas’.

sample_nint, optional

Number of rows to load. For pandas, passed as nrows; for Polars, as n_rows. If None, loads the entire file.

**kwargs

Passed to the underlying reader.

Returns:

: pandas.DataFrame or polars.DataFrame or polars.LazyFrame

Loaded (and optionally sampled) table.

Examples:

>>> # Eager pandas
>>> df = load_csv("data.csv", engine="pandas")
>>> type(df)
<class 'pandas.core.frame.DataFrame'>
>>> # Eager Polars
>>> df = load_csv("data.csv", engine="polars")
>>> type(df)
<class 'polars.internals.frame.DataFrame'>
>>> # Lazy Polars
>>> lf = load_csv("data.csv", engine="polars", lazy=True)
>>> type(lf)
<class 'polars.lazyframe.LazyFrame'>
>>> # Sample first 100 rows with Polars
>>> df = load_csv("data.csv", sample_n=100)
>>> len(df)
100
emrpy.data.load_parquet(file_path, engine='polars', lazy=False, sample_frac=None, sample_n=None, **kwargs)

Load a Parquet file using pandas or Polars, with optional row-count sampling.

Return type:

Union[DataFrame, DataFrame, LazyFrame]

Parameters:

file_pathstr or Path

Path to the Parquet file.

engine{‘pandas’, ‘polars’}, default ‘polars’

Which backend to use: - ‘pandas’: calls pd.read_parquet - ‘polars’: calls pl.read_parquet (eager) or pl.scan_parquet (lazy)

lazybool, default False

If True and engine=’polars’, returns a pl.LazyFrame via pl.scan_parquet. Ignored when engine=’pandas’.

sample_nint, optional

Number of rows to load. For pandas, samples after full load; for Polars, as n_rows. If None, loads the entire file.

**kwargs

Passed to the underlying reader.

Returns:

: pandas.DataFrame or polars.DataFrame or polars.LazyFrame

Loaded (and optionally sampled) table.

Examples:

>>> # Eager pandas
>>> df = load_parquet("data.parquet", engine="pandas")
>>> type(df)
<class 'pandas.core.frame.DataFrame'>
>>> # Eager Polars
>>> df = load_parquet("data.parquet", engine="polars")
>>> type(df)
<class 'polars.internals.frame.DataFrame'>
>>> # Lazy Polars
>>> lf = load_parquet("data.parquet", engine="polars", lazy=True)
>>> type(lf)
<class 'polars.lazyframe.LazyFrame'>
>>> # Sample first 50 rows with Polars
>>> df = load_parquet("data.parquet", sample_n=50)
>>> len(df)
50

Modules

loaders

Data Loading Utilities