spark（scala）第66页

Impala 基于hive的交互式实时分析工具(一) 概念及原理介绍

技术背景impala是参照谷歌的新三篇论文（caffeine-网络搜索引擎，pregel-图形数据库，dremel-瞬时类sql查询）当中的dremel而来，号称是当前大数据领域最快的sql查询工具，比sparksql

章云邰·2023-12-27 19:59

[转帖]SPARC简介

https://www.cnblogs.com/chaohm/p/5674886.html1.概述SPARC（ScalableProcessorARChitecture，可扩展处理器架构）是SUN公司在

weixin_30265103·2023-12-27 19:45

x86、DSP和SPARC的区别

原文链接：添加链接描述目前所接触到的处理器主要有三种，通用微处理器（MPU）、数字信号处理器（DSP）和SPARC平台（来自ScalableProcessorArchitecture的缩写）。

sun_Amay·2023-12-27 19:13

Spark与PySpark(1.概述、框架、模块)

目录1.Spark概念2.Hadoop和Spark的对比3.Spark特点3.1运行速度快3.2简单易用3.3通用性强3.4可以允许运行在很多地方4.Spark框架模块4.1SparkCore4.2SparkSQL4.3SparkStreaming4.4MLlib4.5GraphX5

还是那个同伟伟·2023-12-27 18:06

什么是Spark开发？

1、核心开发：离线批处理/延迟性的交互式数据处理2、SQL查询：底层都是RDD和计算操作3、实时计算：底层都是RDD和计算操作

一个人一匹马·2023-12-27 17:54

python：改进型鳟海鞘算法（SSALEO）求解23个基本函数

参考文献：M.Qaraad,S.Amjad,N.K.Hussein,S.Mirjalili,N.B.HalimaandM.A.Elhosseini,"ComparingSSALEOasaScalableLargeScaleGlobalOptimizationAlgorithmtoHi

IT猿手·2023-12-27 17:39

Flink实时电商数仓之Doris框架（七）

主要实现的功能有：实时看板面向企业内部分析师和管理者的报表面向用户或者客户的高并发报表分析即席查询统一数仓构建：替换了原来由Spark,Hive，Kudu,Hbase等旧框架数据湖联邦查询：通过外表的方式联邦分析位于

十七✧ᐦ̤·2023-12-27 16:47

Spark使用mariadb驱动读取AWS Aurora所有结果数据行都是列名

目录一、使用mariadb驱动读取AWSAurora二、df.show()的内容三、解决办法一、使用mariadb驱动读取AWSAuroravalspark=SparkSession.builder()

瞎胡侃·2023-12-27 15:28

架构设计内容分享(三十)：架构之高可用：负载均衡，容灾备份，故障转移

容灾备份的解决方案故障转移和恢复负载均衡简介面对大量用户访问、高并发请求，海量数据，可以使用高性能的服务器、大型数据库，存储设备，高性能Web服务器，采用高效率的编程语言比如(Go,Scala)等，当单机容量达到极限时

之乎者也··2023-12-27 14:20

Flink 输出至 Redis

org.apache.bahirflink-connector-redis_2.111.0【2】Flink连接Redis并输出Sink处理结果packagecom.zzx.flinkimportorg.apache.flink.streaming.api.scala

程序猿进阶·2023-12-27 14:16

java.lang.IllegalArgumentException: requirement failed: No output operations registered, so nothi...

SparkStreaming报错java.lang.IllegalArgumentException:requirementfailed:Nooutputoperationsregistered,sonothingtoexecute

扣篮的左手·2023-12-27 14:58

Spark与Hadoop的关系和区别

在大数据领域，Spark和Hadoop是两个备受欢迎的分布式数据处理框架，它们在处理大规模数据时都具有重要作用。本文将深入探讨Spark与Hadoop之间的关系和区别，以帮助大家的功能和用途。

晓之以理的喵~~·2023-12-27 12:13

Spark生产集群各种使用

1.环境配置1.1版本说明要求版本是否必须其他事项Hadoop3.3.4是hadoop3.3.0之后原生支持国内主要对象存储Hive3.1.3否实测没有Hive也可以使用sparksql，使用hive更好的管理

tuoluzhe8521·2023-12-27 10:15

Flink on K8S集群搭建及StreamPark平台安装

1.环境准备1.1介绍在使用Flink&Spark时发现从编程模型,启动配置到运维管理都有很多可以抽象共用的地方,目前streampark提供了一个flink一站式的流处理作业开发管理平台,从流处理作业开发到上线全生命周期都做了支持

tuoluzhe8521·2023-12-27 10:45

CentOS7 安装kafka教程及启动

介绍Kafka是分布式发布-订阅消息系统，最初由LinkedIn公司开发，之后成为之后成为Apache基金会的一部分，由Scala和Java编写。

sunboychenll·2023-12-27 08:51

删除azkaban的执行历史

azkaban通常用在大数据任务调度场景，把任务提交之后，如果任务是spark，hive，hadoop，flink等任务的话，

飞有飞言·2023-12-27 07:09

Spark的生态系统概览：Spark SQL、Spark Streaming

ApacheSpark是一个强大的分布式计算框架，用于大规模数据处理。Spark的生态系统包括多个组件，其中两个重要的组件是SparkSQL和SparkStreaming。

晓之以理的喵~~·2023-12-27 06:35

[spark] 存储到hdfs时指定分区

在SparkSQL中指定多个分区字段进行数据存储：类似hive分区存储文章目录代码示例代码importorg.apache.spark.sql.SparkSessionvalspark=SparkSession.builder

言之。·2023-12-27 06:33

米哈游大数据云原生实践

以Spark为例，在云上运行Spark可以充分享有公共云的弹性资源、运维管控和存储服务等，并且业界也涌现了不少SparkonKubernetes的优秀实践。

阿里云云原生·2023-12-27 06:31

[spark] DataFrame 的 checkpoint

在ApacheSpark中，DataFrame的checkpoint方法用于强制执行一个物理计划并将结果缓存到分布式文件系统，以防止在计算过程中临时数据丢失。

言之。·2023-12-27 06:29

[spark] dataframe的cache方法

在ApacheSpark中，DataFrame的cache方法用于将DataFrame的计算结果缓存到内存中，以便在后续的操作中能够更快地访问这些数据。

言之。·2023-12-27 06:59

doris基本操作，03-导入数据-Broker Load

因为Doris表里的数据是有序的，所以Brokerload在导入数据的时是要利用doris集群资源对数据进行排序，相对于Sparkload来完成海量历史数据迁移，对Doris的集群资源占用要比较大，这种方式是在用户没有

车前猛跑·2023-12-27 05:46

黑猴子的家：Scala 超类的构造

在Scala的构造器中，你不能调用super(params)classPerson(valname:String,valage:Int){overridedeftoString=

黑猴子的家·2023-12-27 01:20

orc小文件合并趣谈

这里增量数据采用SparkSQL以动态分区增量写入的方

艾伦_alan·2023-12-27 01:02

分布式系统面试连环炮

他们有共同的一个问题，就是都没怎么搞过分布式系统，现在互联网公司，一般都是做分布式的系统，大家都不是做底层的分布式系统、分布式存储系统hadoophdfs、分布式计算系统hadoopmapreduce/spark

Java机械师·2023-12-26 23:13

为什么Spark比MapReduce快？

MapReduce慢是因为模型很呆板,频繁的Io操作Spark快的话不仅是因为它是内存迭代计算吧？具体什么是内存迭代计算？

tracy_668·2023-12-26 23:00

DolphinScheduler 介绍及系统架构

目录一、DolphinScheduler介绍1.1关于DolphinScheduler1.2特性简单易用丰富的使用场景HighReliabilityHighScalability1.3名词解释1.3.1

Stars.Sky·2023-12-26 22:02

Scala安装

Scala安装使用windows安装,配置环境变量以下载Scala2.11为例，操作在Windows中安装Scala。

新鲜氧气·2023-12-26 22:54

Scala（一）基本类型

Scala语言快速入门（基本类型）一、Linux和Windows环境安装这部分跳过，直接使用IDEA进行搭建，和其他编程语言配置差不多二、HelloWorld1.object表示一个伴生对象（相当于一个对象

新鲜氧气·2023-12-26 22:54

【Spark-HDFS小文件合并】使用 Spark 实现 HDFS 小文件合并

【Spark-HDFS小文件合并】使用Spark实现HDFS小文件合并1）导入依赖2）代码实现2.1.HDFSUtils2.2.MergeFilesApplication需求描述：1、使用Spark做小文件合并压缩处理

bmyyyyyy·2023-12-26 17:15

datasophon组件安装时踩坑记录

identifiedby'xxxx';1.安装hdfs后有一个namenode进程未启动解决：在那个未启动的节点上执行hdfsnamenode-bootstrapStandby之后在web页面重启hdfs2.hiveonspark

州周·2023-12-26 17:56

主流级显卡的新选择，Sparkle（撼与科技）Intel Arc A750兽人体验分享

如果要在ArcA系列当中选一个性能不俗，能够满足生产力与游戏需求，价格方面又不会太高的显卡，那么我手上的这张Sparkle（撼与科技）的IntelArcA750兽人OC显卡就是一个不错的选择。

资讯看点·2023-12-26 14:48

kafka安装部署

1、Kafka概述1.1.Kafka简介ApacheKafka是一个开源消息系统、一个开源分布式流平台，由Scala写成。是由Apache软件基金会开发的一个开源消息系统项目。

Guff_hys·2023-12-26 14:00

2018-11-01 Essence

Theessenceofstartupsisrapidlygrowth.Theessenceofstart-upsisscalability/rapid

桂灰灰·2023-12-26 12:14

六：Spark集群安装和部署

ubuntu16.04系统；(2)Master节点：内存分配2g；Slave1节点：内存分配512MB；Slave2节点：内存分配512MB；2.安装路径：(1)Hadoop2.6.5：/usr/local/；(2)Spark2.6.0

玉成226·2023-12-26 10:21

大数据Spark实战高手之路职业学习路线图

从零起步，分阶段无任何障碍逐步掌握大数据统一计算平台Spark，从Spark框架编写和开发语言Scala开始，到Spark企业级开发，再到Spark框架源码解析、Spark与Hadoop的融合、商业案例和企业面试

smileyboy2009·2023-12-26 10:56

hadoop3.0x 后要比spark快10倍！

smileyboy2009·2023-12-26 10:56

Java SparkSql 2.4.0 ArrayIndexOutOfBoundsException error

在spark2.4中报ArrayIndexOutOfBoundsException原因是Spark2.4.0中引用的paranamer版本是2.7导致问题。

smileyboy2009·2023-12-26 10:56

Iceberg1.4.2 java 表管理（DDL和DML）操作

既然是一种开放的表管理格式，那就不应该依赖hadoop，hive，spark，flink

smileyboy2009·2023-12-26 10:26

spark和flink对比

最近网上和各大公司在对比spark和flink,也有一部分人，演讲时不分析代码原理，不根据事实，直接吹嘘flink比spark好，flink能干掉spark的话，今天就跟大家从技术，应用和未来发展角度对两个产品进行对比

smileyboy2009·2023-12-26 10:25

iceberg1.4.2+spark3.4.2+minio

pom.xml文件需要引入的包org.scala-langscala-library${scala.version}junitjunit4.4testorg.specsspecs1.2.5testorg.apache

smileyboy2009·2023-12-26 10:25

idea开发delta.io数据湖

通过idea的spark操作delta.ideamaven的pom.xmlio.miniominio8.5.7org.apache.sparkspark-core_2.123.5.0o

smileyboy2009·2023-12-26 10:52

pycharm连接虚拟机

前言：我们默认用户已经在虚拟机上安装好了spark等相关集群和生态，是可以在虚拟机中运行相关的操作，比如mapper，reducer操作，rdd，dataframe等等杂七杂八的东西的(主要我也没太明白

俺会hello我的·2023-12-26 07:22

spark：RDD编程（Python版）

RDD运行原理RDD设计背景许多选代目前的MapReduce框架都是把中间结果写入到稳定存储(比如磁盘)中带来了大量的数据复制、磁盘IO和序列化开销RDD就是为了满足这种需求而出现的，它提供了一个抽象的数据架构，我们不必担心底层数据的分布式特性，只需将具体的应用逻辑表达为一系列转换处理，不同RDD之间的转换操作形成依赖关系，可以实现管道化，避免中间数据存储。RDD概念一个RDD就是一个分布式对象集

Mineba·2023-12-26 07:43

SpringBoot 2 集成Spark 3

在奋斗的大道·2023-12-26 06:12

iceberg1.4.2 +minio通过spark创建表，插入数据

下层支持hadoop，s3,对象存储，上层支持hive，spark，flink等应用。实现在中间把两部分隔离开来，实现一种对接和数据管理的标准。有这个标准，不管是谁建的表，都可以操作和访问。

smileyboy2009·2023-12-26 06:39

count distinct在spark中的运行机制

(*),SUM(items),COUNT(DISTINCTproduct),COUNT(DISTINCTcategory)FROMorders;假设源数据分布在两个1核的结点上，数据就8行Expandspark

SLUMBER_PARTY_·2023-12-26 06:08

黑猴子的家：Scala 视图界定

，我们看多一个带上界的示例classPair[TComparable[T]）{defsmaller=if(first.comparaTo(second)<0)firstelsesecond}2、实操在Scala

黑猴子的家·2023-12-26 06:42

【Linux系统基础】（6）在Linux上大数据NoSQL数据库HBase集群部署、分布式内存计算Spark环境及Flink环境部署详细教程

大数据NoSQL数据库HBase集群部署简介HBase是一种分布式、可扩展、支持海量数据存储的NoSQL数据库。和Redis一样，HBase是一款KeyValue型存储的数据库。不过和Redis设计方向不同Redis设计为少量数据，超快检索HBase设计为海量数据，快速检索HBase在大数据领域应用十分广泛，现在我们来在node1、node2、node3上部署HBase集群。安装HBase依赖Zo

老牛源码·2023-12-26 06:13

SparkCore

一、RDD详解1.1什么是RDDRDD（ResilientDistributedDataset）叫做弹性分布式数据集，是Spark中最基本的数据抽象，代表一个不可变、可分区、里面的元素可并行计算的集合。

weixin_50458070·2023-12-26 06:40

推荐频道

spark（scala）

Impala 基于hive的交互式实时分析工具(一) 概念及原理介绍

[转帖]SPARC简介

x86、DSP和SPARC的区别

Spark与PySpark(1.概述、框架、模块)

什么是Spark开发？

python：改进型鳟海鞘算法（SSALEO）求解23个基本函数

Flink实时电商数仓之Doris框架（七）

Spark使用mariadb驱动读取AWS Aurora所有结果数据行都是列名

架构设计内容分享(三十)：架构之高可用：负载均衡，容灾备份，故障转移

Flink 输出至 Redis

java.lang.IllegalArgumentException: requirement failed: No output operations registered, so nothi...

Spark与Hadoop的关系和区别

Spark生产集群各种使用

Flink on K8S集群搭建及StreamPark平台安装

CentOS7 安装kafka教程及启动

删除azkaban的执行历史

Spark的生态系统概览：Spark SQL、Spark Streaming

[spark] 存储到hdfs时指定分区

米哈游大数据云原生实践

[spark] DataFrame 的 checkpoint

[spark] dataframe的cache方法

doris基本操作，03-导入数据-Broker Load

黑猴子的家：Scala 超类的构造

orc小文件合并趣谈

分布式系统面试连环炮

为什么Spark比MapReduce快？

DolphinScheduler 介绍及系统架构

Scala安装

Scala（一）基本类型

【Spark-HDFS小文件合并】使用 Spark 实现 HDFS 小文件合并

datasophon组件安装时踩坑记录

主流级显卡的新选择，Sparkle（撼与科技）Intel Arc A750兽人体验分享

kafka安装部署

2018-11-01 Essence

六：Spark集群安装和部署

大数据Spark实战高手之路职业学习路线图

hadoop3.0x 后要比spark快10倍！

Java SparkSql 2.4.0 ArrayIndexOutOfBoundsException error

Iceberg1.4.2 java 表管理（DDL和DML）操作

spark和flink对比

iceberg1.4.2+spark3.4.2+minio

idea开发delta.io数据湖

pycharm连接虚拟机

spark：RDD编程（Python版）

SpringBoot 2 集成Spark 3

iceberg1.4.2 +minio通过spark创建表，插入数据

count distinct在spark中的运行机制

黑猴子的家：Scala 视图界定

【Linux系统基础】（6）在Linux上大数据NoSQL数据库HBase集群部署、分布式内存计算Spark环境及Flink环境部署详细教程

SparkCore