今天阳光很暖

spark

收录 Spark、Spark SQL、Streaming 与性能优化相关的原理、实践和问题排查。

Spark 消费 Kafka 单节点耗时异常排查 Spark 消费 Kafka 单节点耗时异常排查
1. 问题现象Spark 消费 Kafka 时,大部分节点处理耗时都在 6 秒以内,但是有一个节点每次都要 22 秒左右,日志中没有明显异常。 草稿中记录的现象如下: 这种问题比较麻烦,因为日志没有报错,任务也不是失败,只是某一个节点持续
2024-08-21
Spark 写 MySQL 遇到 Emoji 字符异常分析 Spark 写 MySQL 遇到 Emoji 字符异常分析
1. 问题现象Spark 任务写数据到 MySQL 时,如果字段中包含 emoji 字符,insert 会失败。 草稿中的描述是: spark 写数据到 mysql 包含 emoji 字符导致 insert 失败, 已经将 mysql 的
2024-08-10
Spark SQL 读取 Parquet 字段类型不一致异常分析 Spark SQL 读取 Parquet 字段类型不一致异常分析
1. 问题现象在 Spark SQL 中查询一张 Hive Parquet 表时,任务执行失败,核心异常如下: org.apache.spark.SparkException: Job aborted due to stage failur
2024-05-22
Spark 读取 Hive insert-only 事务表异常分析 Spark 读取 Hive insert-only 事务表异常分析
1. 问题现象在 Spark 程序中执行 Hive 表查询时,程序在 SQL 解析阶段直接失败,异常信息如下: Exception in thread "main" org.apache.spark.sql.AnalysisExceptio
2024-05-06
Spark 操作ES报错 Failed to find data source Spark 操作ES报错 Failed to find data source
1. 异常描述将服务部署到一个新的服务器上抛出了一个关于 ES的 ClassNotFoundException 异常 java.lang.ClassNotFoundException: Failed to find data source:
2023-08-10
SparkML使用逻辑回归算法对新闻多分类 SparkML使用逻辑回归算法对新闻多分类
一、准备数据自从引进DataFrame之后,spark在ml方面,开始使用DataFrame作为RDD的上层封装,以屏蔽RDD层次的复杂操作,对应用开发者提供简单的DataFrame,以减少开发量。本文中使用的是spark 2.4 版本为基
2023-05-16
Spark SQL 读取 Parquet 失败排查:Schema 不一致 Spark SQL 读取 Parquet 失败排查:Schema 不一致
一、问题现象在执行 Spark SQL 查询 Parquet 表时,任务直接失败,并出现如下异常: org.apache.spark.SparkException: Job aborted due to stage failure: Ta
2022-10-23
Spark 数据倾斜分析与解决思路 Spark 数据倾斜分析与解决思路
1. 背景介绍数据倾斜是在大数据计算中,经常会面临一个非常棘手的问题。数据倾斜会导致 Spark 作业性能大幅下降,这远远低于我们的期望。为了确保 Spark 作业的高性能,我们需要进行数据倾斜调优。数据倾斜调优是一项复杂的任务,需要采用多
2022-08-08
Spark Submit 提交任务抛出 IllegalAccessError Spark Submit 提交任务抛出 IllegalAccessError
1. 运行环境 组件 版本 Ambari 2.7.6 Spark 2.3.2 HDFS 3.1.1 2. 提交任务报错信息如下: 使用 spark-submit 提交任务时报错信息 java.lang.Illegal
2022-05-15
spark-sql Required-field-'filesAdded'-is-unset spark-sql Required-field-'filesAdded'-is-unset
1. 背景使用sparkSQL计算数据向一个已经存在数据的分区中写数据报错 使用版本: Spark2 2.3.2 Hive 3.1.0 错误信息如下: org.apache.spark.sql.AnalysisException: or
2019-12-26
SparkML中关联规则的应用 SparkML中关联规则的应用
1. 概念什么是关联规则?(Association Rules) 关联规则是数据挖掘中的概念, 通过分析数据, 找到数据之间的关联, 电商中经常用来分析购买商品之间的相关性, 例如,”购买尿布的用户 有大概率购买啤酒”, 这就是一个关联规
2019-12-24
Spark中parallelize函数和makeRDD函数的区别 Spark中parallelize函数和makeRDD函数的区别
我们知道,在Spark中RDD的创建方式大概可以分为三种: 从集合中创建RDD, 从外部存储中创建RDD, 从其他RDD创建 而从集合中创建RDD,Spark主要提供了两种函数:parallelize 和 makeRDD。我们可以先看看
2019-12-18
1 / 5