Idea
A scalable pipeline that harmonizes multi-institutional EHR data into standardized, research-ready datasets for healthcare researchers and institutions
Research Paper
Core Innovation
This paper introduces PEHRT, a pipeline that uniquely combines data pre-processing with representation learning to harmonize EHR data across institutions without sharing individual-level data. Unlike prior approaches, PEHRT is data model agnostic and leverages machine learning to generate standardized, research-ready datasets efficiently. It enables multi-institutional collaboration while addressing semantic differences and privacy concerns.
Market Size (TAM)
$10–20B TAM, $2–5B SAM; assumption: growing demand for interoperable EHR data in research and healthcare analytics sectors.
Potential Customers & Pain Points
- Healthcare Research Institutions needing standardized multi-source EHR data
- Hospitals and Health Systems facing data heterogeneity and privacy challenges
- Pharmaceutical Companies conducting translational research requiring diverse patient cohorts
Business Model
Open source core with enterprise licensing for advanced features, support, and custom integration services
Competitive Landscape
- OHDSI
- FHIR
- i2b2
Implementation Challenges
- Institutional resistance to data sharing
- Complexity of integrating heterogeneous EHR systems
- Regulatory and privacy compliance challenges
Validation Strategy
- Pilot deployment with partner healthcare institutions
- Benchmark harmonized datasets against existing standards
- Demonstrate improved research outcomes using PEHRT datasets
Research Paper Overview
PEHRT: A Common Pipeline for Harmonizing Electronic Health Record data for Translational Research
Summary
PEHRT is a standardized pipeline that harmonizes multi-institutional EHR data by mapping to standard coding systems and applying machine learning to create research-ready datasets without sharing individual-level data. It is data model agnostic and designed for easy deployment across healthcare institutions, demonstrated on diverse real-world datasets.