spark（scala）第50页

pyspark之Structured Streaming window函数-滚动模式

#file文件使用pyspark之StructuredStreamingfile文件案例1生成文件，以下代码主要探讨window函数使用window三种方式：滚动、滑动、会话，只有windowDuration

heiqizero·2024-01-21 06:59

pyspark之Structured Streaming结果保存到Mysql数据库-socket例子统计(含批次)

frompyspark.sqlimportSparkSession,DataFramefrompyspark.sql.functionsimportexplode,split,lit"""实现将数据保存到

heiqizero·2024-01-21 06:28

Spark面试题

1.sparkcore1.简述hadoop和spark的不同点（为什么spark更快）♥♥♥ shuffle都是需要落盘的，因为在宽依赖中需要将上一个阶段的所有分区数据都准备好，才能进入下一个阶段，那么如果一直将数据放在内存中

韩顺平的小迷弟·2024-01-21 06:53

一文详解pyspark中sql的join

大家好，今天分享一下pyspark中各种sqljoin。数据准备本文以学生和班级为单位进行介绍。学生表有sid（学生id）、sname（学生姓名）、sclass（学生班级id）。

不负长风·2024-01-21 06:23

pyspark之Structured Streaming file文件案例1

#generate_file.py#生成数据生成500个文件,每个文件1000条数据#生成数据格式：eventtimenameprovinceaction()时间用户名省份动作)importosimporttimeimportshutilimporttimeFIRST_NAME=['Zhao','Qian','Sun','Li','Zhou','Wu','Zheng','Wang']SECOND_

heiqizero·2024-01-21 06:23

Spark和Flink的区别?

Flink和Spark都是基于内存计算、支持实时/批处理等多种计算模式的统一框架1,技术理念不同Spark的技术理念是使用微批来模拟流的计算,基于Micro-batch,数据流以时间为单位被切分为一个个批次

写scala的老刘·2024-01-21 06:42

Flutter实现windows应用版本升级功能

可以使用auto_updater库，这个插件允许Flutter桌面应用自动更新自己(基于sparkle和winsparkle)地址如下：https://github.com/leanflutter/auto_updater

落华X·2024-01-21 05:32

一文读懂Delta Lake：大数据时代的数据湖框架新选择！

介绍：DeltaLake是一个开源存储层，为ApacheSpark和大数据工作负载提供了ACID事务能力。这个存储层由Databricks公司推出，并已成为数据湖方案的重要组成部分。

知识分享小能手·2024-01-21 03:56

111.Parquet表的使用

Avro,Thrift,ProtocolBuffers,POJOs查询引擎:Hive,Impala,Pig,Presto,Drill,Tajo,HAWQ,IBMBigSQL计算框架:MapReduce,Spark

大勇任卷舒·2024-01-21 02:33

通过WordCount解析Spark RDD内部源码机制

我们通过SparkWordCount动手实践，编写单词计数代码；在wordcount.scala的基础上，从数据流动的视角深入分析SparkRDD的数据处理过程。

联旺·2024-01-21 01:54

spark on Yarn 动态资源分配

配置文件：spark.default.parallelism=40#spark.executor.memory=1536m#spark.executor.memoryOverhead=512m#spark.driver.cores

金刚_30bf·2024-01-20 23:09

Spark读取kafka（流式和批数据）

spark读取kafka（批数据处理）#按照偏移量读取kafka数据frompyspark.sqlimportSparkSessionss=SparkSession.builder.getOrCreate

中长跑路上crush·2024-01-20 23:55

Spark流式读取文件数据

流式读取文件数据frompyspark.sqlimportSparkSessionss=SparkSession.builder.getOrCreate()#todo注意1：流式读取目录下的文件--》一定一定要是目录

中长跑路上crush·2024-01-20 23:25

Spark Streaming通过receiver方式消费kafka数据时数据积压问题

1.问题在通过receiver方式接受kafka消息时，发现有大量消息在队列中阻塞最终导致spark任务执行失败。

sinat_36710456·2024-01-20 22:23

Spark(一): 基本架构及原理

前言:目标：架构及生态：Spark与hadoop:运行流程及特点：常用术语:Spark运行模式：RDD运行流程：前言:ApacheSpark是一个围绕速度、易用性和复杂分析构建的大数据处理框架，最初在2009

贝賏赑钡·2024-01-20 22:46

PDF如何裁剪页面，PDF裁剪页面的小技巧

使用工具：旋风PDF编辑器下载地址：http://www.679sparkle.com/pdfeditor操作方法：1：先打开旋风PDF编辑器，点击打开文件按钮打开需要编辑的PDF文件。2：在菜单

六号_db7a·2024-01-20 18:09

11.Join的MapReduce实现

Join在MapReduce中的实现一、概述tips:Hive:MapReduce/Spark巧用explain查看语法树常见的面试题:描述如何使用MapReduce来实现join功能：考察点MapReduce

哈哈大圣·2024-01-20 18:40

【时间日期转换】将字符串转换为日期并指定时区（Scala实现）

/***将给定的时间字符串转换成日期,并指定时区**dateStr给定的时间字符串(格式应该与pattern参数一致)*pattern时间字符串的格式*timeZoneId时区Id,默认取系统本地设置的时区**@paramdateStr*@parampattern*@paramtimeZoneId*@return*/defparseDate(dateStr:String,pattern:Strin

syb18810107241·2024-01-20 18:38

Spark在降本增效中的一些思考

背景在大环境不好的情况下,本司也开始了“降本增效”，本文探讨一下，在这种背景下Spark怎么做的降本增效。

鸿乃江边鸟·2024-01-20 14:25

hive 运行报错

Error:Errorwhilecompilingstatement:FAILED:UDFArgumentTypeExceptionExactlyoneargumentisexpected.近期用spark

圆周率的后六位·2024-01-20 12:35

111、Scala编程进阶之文件操作实战详解

遍历一个文件中的每一行必须导入scala.io.Source类:importscala.io.Source方法一:使用Source.getLines返回的迭代器valsource=Source.fromFile

ZFH__ZJ·2024-01-20 11:56

设计模式——管道模式（并发模式）

在分布式处理领域，由于管道模式是数据驱动，而目前流行的Spark分布式处理平台也是数据驱动的，两者非常合拍，于是在spar

码上得天下·2024-01-20 11:52

spark的jdbc接口，类似于hiveserver2

https://spark.apache.org/docs/2.4.0/sql-distributed-sql-engine.html#running-the-thrift-jdbcodbc-serverSparkSQL

zdkdchao·2024-01-20 10:53

Hadoop基础知识

它的核心组件有：HDFS（分布式文件系统）：解决海量数据存储YARN（作业调度和集群资源管理的框架）：解决资源任务调度MAPREDUCE（分布式运算编程框架）：解决海量数据计算2、Hadoop特性优点扩容能力（Scalable

坐在风口上de猪·2024-01-20 10:10

Kafka框架详解

Kafka1、Kafka介绍Kafka是最初由linkedin公司开发的，使用scala语言编写，kafka是一个分布式，分区的，多副本的，多订阅者的消息队列系统。

坐在风口上de猪·2024-01-20 10:23

Kylin安装学习教程

Kylin安装学习教程Kylin是一个开源的分布式分析引擎，提供Hadoop/Spark之上的SQL接口及多维分析（OLAP）能力以支持大数据分析，最初由eBayInc.开发并贡献到开源社区。

Luo_Yang111·2024-01-20 09:28

spark连接操作

将有键的数据与另一组有键的数据一起使用是对键值对数据执行的最有用的操作之一。连接数据可能是PairRDD最常用的操作之一。连接的方式多种多样：右外连接，左外连接、交叉连接以及内连接普通的join操作符表示是内连接。只有在两个键值对中都存在的键才叫输出。

追赶的程序猿·2024-01-20 09:45

Hack The Box-Sherlocks-Tracer

AjuniorSOCanalystondutyhasreportedmultiplealertsindicatingthepresenceofPsExeconaworkstation.TheyverifiedthealertsandescalatedthealertstotierII.AsanIncidentresponderyoutriagedtheendpointforartefact

0415i·2024-01-20 08:29

Data Bricks Delta Lake 入门

DeltaLake是一个开源存储层，它将关系数据库语义添加到基于Spark的数据湖处理中。

AI普惠大师·2024-01-20 07:03

Spark从入门到精通30:Spark SQL：核心源码深度剖析

在前面一节我们讲解了SparkSQL的工作原理，接下来在这一节，我们对SparkSQL工作原理进一步地深入和加强，这一节主要讲解SparkSQL核心源码导读和剖析首先，我们看SQLContext.scala

勇于自信·2024-01-20 07:57

【Spark】Spark 容错及 HA--Master 异常

一、Master配置recoveryModeMaster作为SparkStandalone模式中的核心，如果Master出现异常，则整个集群的运行情况和资源将无法进行管理，整个集群将处于“群龙无首”的状况

w1992wishes·2024-01-20 05:37

余老师带你学习大数据-Spark快速大数据处理第十章Kafka第八节Kafka-Connect

kafkaKafkaConnect基本概念1、KafkaConnect是Kafka流式计算的一部分，左侧是数据源包括了数据库、hadoop、文本等等，右侧是数据结果包括了文本、hadoop、数据库，中间上层就是KafkaConnect，它里面会有很多的输入，将输入的内容的读取进来转交给Kafka里，也有可能将kafka里的内容拿出来放到我们的外部数据源中。2、KafkaConnect主要用来与其他

weixin_45810046·2024-01-20 03:41

敏捷漫画#84-升级障碍

升级障碍（Escalatingimpediments）图1图2图3图4作者评论：当然，升级障碍（impediment）与升级冲突（conflict）是不同的。

小船哥说敏捷·2024-01-20 03:58

kylin安装学习教程

ApacheKylin是一个开源的分布式分析引擎，提供Hadoop/Spark之上的SQL接口及多维分析（OLAP）能力以支持大数据分析，最初由eBayInc.开发并贡献到开源社区。

打工人何苦为难打工人·2024-01-20 03:07

Kylin安装学习教程

ApacheKylin是一个开源的分布式分析引擎，提供Hadoop/Spark上的SQL查询接口及多维分析（OLAP）能力以支持超大规模数据。

终将老去的穷苦程序员·2024-01-20 03:04

CVE-2023-46226 Apache iotdb远程代码执行漏洞

它具有体量轻、性能高、易使用的特点，完美对接Hadoop与Spark生态，适用于工业物联网应用中海量时间序列数据高速写入和复杂分析查询的需求。

棱镜七彩·2024-01-20 02:27

08 Scala sequence comprehensions (序列解析)

语法：for(enumerators)yieldeenumerators为用分号间隔开的变量生成器或者过滤器（if），yield返回值，两个例子：deffoo(n:Int,v:Int)=for(i=20&&user.ageprintln(name))//printsTravisDennis

ceaseless·2024-01-20 01:45

【tensorflow】[Python] tensorflow tensor的批量条件改值如何修改tensor中符合特定条件的元素值将满足特定规则的tensor元素值修改

np.where(x<3)]=3的形式将其批量改成这种批量的条件判断改值，由于tensor不能直接用索引修改值尝试了几种方法，比如更改为Varient、numpy等会出现TypeError:onlyintegerscalararrayscanbeconvertedtoascalarindex

gongfpp·2024-01-20 01:23

21大软件架构特点的全面解析

来源：21大软件架构特点的全面解析(qq.com)众所周知，架构特点多以"ility"结尾（例如scalability、deployability），也被称为NFR（非功能需求）、质量属性。

gqltt·2024-01-20 00:08

kafka--Kafka剖析（一）：Kafka背景及架构介绍

cm_mc_uid=84038470819814925729668&cm_mc_sid_50200000=1498544573kafka是由LinkedIn开发的一个分布式的消息系统，使用Scala编写

Tate-Ling·2024-01-19 23:34

自然语言处理大数据：spark ML Word2Vec详解

简介Word2Vec是一种著名的词嵌入（WordEmbedding）方法，它可以计算每个单词在其给定语料库环境下的分布式词向量（DistributedRepresentation，亦直接被称为词向量）。词向量表示可以在一定程度上刻画每个单词的语义。如果词的语义相近，它们的词向量在向量空间中也相互接近，这使得词语的向量化建模更加精确，可以改善现有方法并提高鲁棒性。词向量已被证明在许多自然语言处理问题

nnnancyyy·2024-01-19 17:23

20181101每日一词|essence

创业公司的精髓是快速增长（可规模化）参考翻译：Theessenceofstart-upsisscalability/rapidgrowth.师者，所以传道授业解惑也。

罗罗ph·2024-01-19 17:28

黑猴子的家：Scala 插值器

格式化的字符串是Scala类库预定义的三个字符串插值器之一packagecom.heihouzi.unit01/***@author黑猴子*/objectFunctionModule{defmain(args

黑猴子的家·2024-01-19 16:45

某小外包公司线上面试-大数据开发

6.java，scala会用吗？7.期望薪资多少？（感觉说出来就无了）面的初级岗附上hr问的问题？1.公司开发人员占比？公司规模？

劝学-大数据·2024-01-19 16:03

大数据学长面试之OPPO面试题

1）技术部分（1）SparkStreaming消费方式及区别，Spark读取HDFS的数据流程（2）Kafka高性能（3）Hive调优，数据倾斜（4）Zookeeper怎么避免脑裂，什么是脑裂。

大数据小理·2024-01-19 16:01

某汽车外包-大数据开发-面试

4.spark的提交参数有那些命令5.sparkrdd,dataframe,dataSe解释一下。

劝学-大数据·2024-01-19 16:28

spark读取MySQL数据机器学习预测存入MySQL

importorg.apache.spark.SparkConfimportorg.apache.spark.ml.classification.

大数据驱动·2024-01-19 14:12

关于jenkins集成python的单元测试

最近在研究jenkins的集成，然后想把自己写的python工具也用jenkins集成一下废话少说，来看结构sparking.py@author:lianying'''classSparking:@staticmethoddefget_num_of_zero

百晓生说测试·2024-01-19 13:21

html源码（html+css）

运维&从测试>UI设计>产品>我的课程表继续学习程序语言设计正在学习-使用对象继续学习程序语言设计正在学习-使用对象继续学习程序语言设计正在学习-使用对象全部课程精品推荐JQuerySparkMySQLJava

奇遇少年·2024-01-19 11:26

【OpenCV】C++版本基础知识总结

文章目录前言一、Mat二、Scalar三、Point四、Rect前言C++opencv总结一、Mat在OpenCV中，cv::Mat是一个非常重要的类，用于表示图像或多维数组。

行走的学习机器·2024-01-19 11:17

推荐频道

spark（scala）

pyspark之Structured Streaming window函数-滚动模式

pyspark之Structured Streaming结果保存到Mysql数据库-socket例子统计(含批次)

Spark面试题

一文详解pyspark中sql的join

pyspark之Structured Streaming file文件案例1

Spark和Flink的区别?

Flutter实现windows应用版本升级功能

一文读懂Delta Lake：大数据时代的数据湖框架新选择！

111.Parquet表的使用

通过WordCount解析Spark RDD内部源码机制

spark on Yarn 动态资源分配

Spark读取kafka（流式和批数据）

Spark流式读取文件数据

Spark Streaming通过receiver方式消费kafka数据时数据积压问题

Spark(一): 基本架构及原理

PDF如何裁剪页面，PDF裁剪页面的小技巧

11.Join的MapReduce实现

【时间日期转换】将字符串转换为日期并指定时区（Scala实现）

Spark在降本增效中的一些思考

hive 运行报错

111、Scala编程进阶之文件操作实战详解

设计模式——管道模式（并发模式）

spark的jdbc接口，类似于hiveserver2

Hadoop基础知识

Kafka框架详解

Kylin安装学习教程

spark连接操作

Hack The Box-Sherlocks-Tracer

Data Bricks Delta Lake 入门

Spark从入门到精通30:Spark SQL：核心源码深度剖析

【Spark】Spark 容错及 HA--Master 异常

余老师带你学习大数据-Spark快速大数据处理第十章Kafka第八节Kafka-Connect

敏捷漫画#84-升级障碍

kylin安装学习教程

Kylin安装学习教程

CVE-2023-46226 Apache iotdb远程代码执行漏洞

08 Scala sequence comprehensions (序列解析)

【tensorflow】[Python] tensorflow tensor的批量条件改值 如何修改tensor中符合特定条件的元素值 将满足特定规则的tensor元素值修改

21大软件架构特点的全面解析

kafka--Kafka剖析（一）：Kafka背景及架构介绍

自然语言处理大数据：spark ML Word2Vec详解

20181101每日一词|essence

黑猴子的家：Scala 插值器

某小外包公司线上面试-大数据开发

大数据学长面试之OPPO面试题

某汽车外包-大数据开发-面试

spark读取MySQL数据机器学习预测存入MySQL

关于jenkins集成python的单元测试

html源码（html+css）

【OpenCV】C++版本基础知识总结

【tensorflow】[Python] tensorflow tensor的批量条件改值如何修改tensor中符合特定条件的元素值将满足特定规则的tensor元素值修改