Roles · Data Engineer · Principal

What a Principal } should know

45 core skills, 60 in total. Expectations per skill, and what changes at the next level.

This page lists what a Principal } is expected to know and do, skill by skill. Core skills are the ones a manager and peers assess in a review cycle; the rest count only in self-assessment. Main areas: Programming Fundamentals, Backend Development, Database Management.

45core skills
15additional skills
10skill areas
100%at Advanced or Expert
Assess myself as Principal Full role matrix

Core skills for a Principal

Grouped by area. The label on the right is the expected depth: Awareness, Working, Advanced or Expert.

Programming Fundamentals · 5

Defines data platform performance strategy. Designs algorithms for petabyte-scale dataset processing: partitioning, bucketing, approximate algorithms (HyperLogLog, Count-Min Sketch). Balances throughput and latency at the architecture level.

Designs data platform async architecture: event-driven ingestion, async CDC, streaming pipelines with exactly-once semantics. Defines strategy for scaling real-time processing through Kafka Streams and Flink.

Defines data platform technical quality strategy. Plans migrations between Spark/Airflow versions. Establishes pipeline reliability metrics: SLA, data freshness, completeness.

Designs platform data models: columnar formats (Parquet, ORC) for analytics, row-based for transactions, graph structures for lineage. Defines serialization/deserialization strategy for cross-system compatibility.

Shapes data platform architectural model: plugin system for connectors, abstractions for data sources/sinks. Defines where OOP is justified and where functional style (PySpark transformations) is preferable.

Backend Development · 6

Apache Kafka Expert

Designs organizational streaming platform: multi-cluster Kafka, MirrorMaker 2, tiered storage. Defines governance for event schemas and data contracts between producer/consumer teams.

Designs data mesh search infrastructure: federated search across domain catalogs, ML ranking for data discovery, cross-cluster search.

Designs data platform API layer: self-service data portal, metadata API, data marketplace. Defines API standards for data access through query engines (Trino, Presto).

Redis Expert

Designs data platform caching infrastructure: shared Redis for cross-pipeline lookup data, warming strategies during deployments, partitioning for scaling.

Designs object storage architecture: multi-region replication, S3-compatible storage (MinIO) for on-prem, cost optimization through storage classes. Defines governance for data retention.

Task Queues Expert

Designs distributed processing architecture: task queues for near-real-time vs batch schedulers, hybrid approaches. Defines SLA and capacity planning for different priority levels.

Database Management · 9

Designs NoSQL strategy for data platform: Cassandra for high-write ingestion, ScyllaDB for low-latency lookups. Defines data modeling best practices for wide-column stores and Spark integration for batch analytics.

Designs data resilience strategy: multi-region replication, cross-cloud DR, cold/warm/hot backup tiers. Defines governance for data protection and compliance (GDPR right to delete).

ClickHouse Expert

Designs platform OLAP strategy: ClickHouse cluster topology, cross-DC replication, capacity planning. Defines when ClickHouse vs Snowflake/BigQuery. Plans data serving layer architecture.

Designs organizational data modeling strategy: domain-driven data models, canonical data model, data mesh domain boundaries. Defines governance for entity resolution and master data management.

Designs data platform indexing strategy: columnar indexes (Parquet row groups), zone maps, min/max statistics. Defines indexing approaches for data lake (Iceberg metadata) and data warehouse.

Designs schema management platform: schema registry, versioned data contracts, automated compatibility checking. Defines governance for schema evolution in data mesh.

PostgreSQL Expert

Designs PostgreSQL strategy: logical replication for real-time CDC, Citus for distributed analytics, TimescaleDB for time-series pipelines. Defines PostgreSQL boundaries in data architecture.

Designs query optimization strategy: federated queries through Trino/Presto, query caching, materialized views. Defines SLA for query latency by type: ad-hoc, scheduled, interactive.

Designs platform data replication strategy: CDC through Debezium/Kafka Connect, cross-region replication for geo-distributed analytics, multi-master scenarios. Defines consistency guarantees for different data products.

API & Integration · 2

Designs data platform serialization strategy: unified schema registry, cross-format compatibility, schema evolution governance. Defines when Protobuf vs Avro vs Parquet schemas.

Designs data mesh API strategy: domain data product API, federated data access layer, API gateway for data services. Defines standards for data-as-a-product interfaces.

Cloud & Infrastructure · 4

AWS Expert

Designs cloud data strategy: multi-cloud (AWS + GCP/Azure), data residency compliance, vendor lock-in mitigation. Defines reference architecture for cloud-native data platform.

Docker Expert

Designs container strategy for data platform: runtime standardization for Spark/Airflow/dbt, image governance, registry architecture. Defines container vs serverless for different workloads.

Designs Kubernetes platform for data: multi-cluster for staging/production, spot instances for batch, dedicated nodes for streaming. Defines compute strategy and cost optimization.

Terraform Expert

Designs organizational IaC strategy: self-service infrastructure provisioning for data teams, cost controls, compliance automation. Defines multi-cloud infrastructure abstraction.

DevOps & CI/CD · 1

Designs CI/CD strategy for data platform: unified pipeline for different data tools (dbt, Airflow, Spark), environment management, data infrastructure provisioning. Defines release governance.

Data Engineering · 14

Designs orchestration strategy: Airflow for batch, event-driven for real-time, hybrid patterns. Defines multi-team governance, shared infrastructure, cost allocation.

Apache Spark Expert

Designs platform Spark strategy: EMR vs Databricks vs self-hosted, cluster sizing, dynamic allocation. Defines when Spark vs DuckDB vs Polars. Plans migration to Spark 4.0.

Designs next-gen orchestration: Dagster for software-defined data assets, Prefect for event-driven, hybrid with Airflow legacy. Defines migration path and coexistence strategy.

Data Catalog Expert

Designs organizational metadata platform: federated catalog for data mesh, automated metadata extraction, ML-powered data discovery. Defines metadata governance and interoperability standards.

Designs data contract platform: centralized registry, automated enforcement, compatibility checking. Defines governance model for inter-team data sharing in data mesh.

Designs data lakehouse architecture: unified storage layer, query engine federation (Trino/Spark), governance framework. Defines when lakehouse vs traditional DWH vs data mesh.

Data Lineage Expert

Designs organizational lineage platform: end-to-end lineage from operational systems to BI dashboards, automated compliance reporting, lineage-driven data governance.

Data Quality Expert

Designs data quality platform: centralized quality monitoring, ML-based anomaly detection, quality-driven data trust scoring. Defines organization-wide data quality framework.

Designs organizational DWH strategy: centralized vs decentralized, semantic layer, cost management. Defines evolution path: traditional DWH → lakehouse → data mesh. Plans cross-platform migration.

dbt Expert

Designs transformation strategy: dbt for SQL transformations, Spark for complex processing, dbt mesh for multi-team. Defines governance for shared models and cross-project dependencies.

Designs open table format strategy: Delta Lake vs Iceberg vs Hudi, catalog integration (Unity/Nessie), cross-engine interop. Defines migration path from Hive tables.

Defines local data processing strategy: DuckDB for ad-hoc analytics, Polars for batch ETL, Arrow for zero-copy data exchange. Designs unified API for different backends.

SQL-based ETL Expert

Designs transformation strategy: SQL for declarative ETL, Python for complex logic, hybrid approaches. Defines query engine selection (Trino, BigQuery, Redshift) by workload pattern.

Designs data platform streaming architecture: Kafka Streams for lightweight processing, Flink for complex CEP, hybrid batch+streaming. Defines lambda vs kappa architecture by scenario.

AI-Assisted Development · 1

Defines AI-assisted data engineering strategy: tool selection, governance policies, quality gates for AI-generated code and SQL. Evaluates LLM-based data tools (text-to-SQL).

Observability & Monitoring · 1

Shapes data platform observability strategy: unified logging for Airflow/Spark/dbt, data-specific metrics (freshness, completeness, volume), automated anomaly detection.

Version Control & Collaboration · 2

Code Review Expert

Defines organizational review standards: cross-team review for shared data models, architectural review board for platform changes. Builds engineering excellence culture.

Git Advanced Expert

Defines data platform versioning strategy: mono vs multi-repo for dbt/Airflow/infra, release management for data pipeline changes. Coordinates cross-team collaboration.

Additional skills

Not assessed by the team, but part of the self-assessment and the development plan.

API DocumentationChatGPT / ClaudeDesign PatternsE2E TestingGraphQL DesignIntegration TestingJWT / OAuth2 / OIDCMultithreadingOpenTelemetryOWASP & Application SecuritySecure Coding PracticesSLI / SLO / SLASystem Design FundamentalsType Safety & Type SystemsUnit Testing
Run this with your whole team
Self-assessment plus manager and peer reviews against the same matrix, gap analysis and next-level readiness for every engineer. Team Pro is free for 14 days; individual tools stay free forever.
Start a team trial (14 days free) Send to my manager

} in the open competency matrix: 60 skills across 5 levels. The matrix is free for individuals and stays free.