
Quick Start 是 Apache Spark 4.0.0 官方文档中的入门教程页面(对应文档版本标记 4.2.0),地址为 https://spark.apache.org/docs/latest/quick-start.html。本教程旨在为使用者提供 Spark 的快速入门指导,首先通过 Spark 的交互式 Shell(Python 或 Scala)介绍其 API,随后演示如何使用 Java、Scala 和 Python 编写独立应用程序。
根据文档说明,在 Spark 2.0 之前,其主要编程接口为弹性分布式数据集(RDD);Spark 2.0 之后,RDD 被 Dataset 取代,Dataset 具有强类型特征且具备更丰富的底层优化。RDD 接口仍受支持,但官方强烈建议改用性能更优的 Dataset。
./bin/pyspark 或环境中用 pip 安装后运行 pyspark。Dataset[Row],引出 DataFrame(带列名的 Dataset)概念。pyspark.sql.functions 进行映射、聚合(如查找含词数最多的行),并轻松实现 MapReduce 式流程(拆分、分组、计数)。cache() 标记缓存。setup.py 中声明 pyspark==4.2.0 依赖,以及用 SparkSession 编写 SimpleApp.py 读取文件并统计包含特定字符行数的基本流程。跟随本指南前,需先从 Spark 官网下载已打包的 Spark 发布版;若不使用 HDFS,可下载适配任意 Hadoop 版本的包。完成安装后,即可通过 Shell 或编写应用体验上述功能。更多细节可参阅文档中的 RDD 编程指南与 SQL 编程指南。