Core features of the Spark-Cassandra-Connector
trunkThe connector provides high-performance integration between Apache Spark and Apache Cassandra with the following capabilities:
- Data Abstraction: Exposes Cassandra tables as Spark RDDs and Datasets/DataFrames.
- Mapping: Maps table rows to
CassandraRowobjects or tuples, with a customizable object mapper for user-defined classes. - Write Operations: Saves RDDs back to Cassandra via implicit
saveToCassandracalls and deletes rows/columns via implicitdeleteFromCassandracalls. - Optimized Joins: Provides
joinWithCassandraTablefor RDDs and optimized joins for Datasets/DataFrames. - Data Locality: Supports partitioning RDDs according to Cassandra replication using
repartitionByCassandraReplica. - Querying: Supports server-side filtering via CQL
WHEREclauses and execution of arbitrary CQL statements. - Advanced Types: Supports all Cassandra data types (including collections) and recently added support for vector types (for Cassandra 5.0 and Astra vectors) to support AI/RAG workflows.