Skip to content

Getting Started

Anish Raj edited this page May 23, 2026 · 1 revision

Getting Started

This page helps new users install Arnio and run a first data preparation workflow.

Install

pip install arnio

Arnio supports Python 3.9 through 3.14. The core package depends on pandas and NumPy.

Optional extras:

pip install "arnio[arrow]"
pip install "arnio[parquet]"
pip install "arnio[sklearn]"

For development:

pip install -e ".[dev,parquet]"

First Workflow

import arnio as ar

frame = ar.read_csv("data.csv")

print(frame.columns)
print(frame.dtypes)
print(frame.preview())

Clean Data

clean = ar.pipeline(frame, [
    ("strip_whitespace",),
    ("normalize_case", {"case_type": "lower"}),
    ("drop_nulls",),
    ("drop_duplicates",),
])

Profile Data Quality

report = ar.profile(clean)

print(report.summary())
print(report.to_markdown())

Validate a Data Contract

schema = ar.Schema({
    "id": ar.Int64(nullable=False, unique=True),
    "email": ar.Email(nullable=False),
    "revenue": ar.Float64(nullable=True, min=0.0),
})

result = schema.validate(clean)

print(result.passed)
print(result.to_markdown())

Convert Back to pandas

df = ar.to_pandas(clean)

Use copy=True when you need defensive pandas-owned buffers:

safe_df = ar.to_pandas(clean, copy=True)

Next Steps

Clone this wiki locally