Hands-on learning lab for embodied robot data pipelines, quality, annotation, and evaluation
This diagram is the learning target for the repository. Components will be implemented incrementally rather than as production services.
flowchart LR
subgraph sources["Robot data sources"]
lerobot["LeRobot"]
rlds["RLDS / DROID"]
ros["ROS bag / MCAP"]
end
subgraph ingestion["Ingestion"]
adapters["Data adapters"]
recorder["Recorder and session manifest"]
end
subgraph semantics["Canonical semantics"]
episode["Canonical Episode<br/>Episode / Segment / Frame"]
embodiment["Schema and embodiment registry"]
calibration["Calibration, coordinate frames,<br/>units and timebase"]
end
subgraph processing["Processing and data intelligence"]
alignment["Time and coordinate alignment"]
video["Video processing and segmentation"]
quality["Quality rules and scoring"]
annotation["Ontology, prompts and VLM annotation"]
retrieval["Embedding search and deduplication"]
end
subgraph datasets["Dataset production"]
lineage["Dataset registry and lineage"]
recipe["Dataset recipe, sampling and splits"]
export["LeRobot / RLDS export"]
end
subgraph feedback["Learning and feedback"]
training["Policy training"]
evaluation["Evaluation slices"]
badcase["Bad-case analysis"]
collection["Coverage gaps and collection plan"]
end
sources --> adapters
recorder --> episode
adapters --> episode
embodiment --> episode
calibration --> episode
episode --> alignment --> video
video --> quality
video --> annotation
quality --> retrieval
annotation --> retrieval
retrieval --> lineage --> recipe --> export
export --> training --> evaluation --> badcase
badcase --> collection
badcase --> quality
badcase --> annotation
collection --> recorder