Interfaccia di Python per Apache Spark che consente l'elaborazione distribuita dei dati tramite operazioni DataFrame, pipeline ML e analisi in streaming su larga scala
Apache Spark è scritto in linguaggio di programmazione Scala. PySpark è stato lanciato per supportare la collaborazione fra Apache Spark e Python; si tratta sostanzialmente di un'API Python per Spark. Inoltre, PySpark aiuta a interfacciarsi con Resilient Distributed Dataset (RDD) nel linguaggio di programmazione di Apache Spark e Python. Questo è possibile grazie alla libreria Py4j.

Py4J è una libreria molto diffusa, integrata in PySpark, che consente a Python di interfacciarsi dinamicamente con oggetti JVM. PySpark offre diverse librerie per scrivere programmi efficienti. Inoltre, esistono molte altre librerie esterne compatibili. Eccone alcune.
Libreria PySpark per eseguire analisi tipo SQL su grandi quantità di dati strutturati o semi-strutturati. Con PySparkSQL si possono eseguire anche query SQL. Inoltre, può essere collegata ad Apache Hive. Si può applicare anche HiveQL. PySparkSQL è un wrapper che avvolgere il core di PySpark. PySparkSQL ha introdotto il DataFrame, una rappresentazione tabellare di dati strutturati simile alla tabella di un sistema di gestione di database relazionali.