E-COM-NET
首页
在线工具
Layui镜像站
SUI文档
联系我们
推荐频道
Java
PHP
C++
C
C#
Python
Ruby
go语言
Scala
Servlet
Vue
MySQL
NoSQL
Redis
CSS
Oracle
SQL Server
DB2
HBase
Http
HTML5
Spring
Ajax
Jquery
JavaScript
Json
XML
NodeJs
mybatis
Hibernate
算法
设计模式
shell
数据结构
大数据
JS
消息中间件
正则表达式
Tomcat
SQL
Nginx
Shiro
Maven
Linux
spark(scala)
CalvinFS: Consistent WAN Replication and
Scala
ble Metadata Management for Distributed File...——论文泛读
FAST2015Paper元数据论文阅读汇总问题现有的文件系统,即使是存储数百PB数据的可伸缩系统,也会将文件元数据存储在单个服务器上,或通过共享磁盘架构,以确保元数据的一致性和有效性。文件系统在可扩展性和跨数据中心实现方面还有不足。尽管已经开发了许多分布式文件系统以扩展到数千台计算机的集群,但由于在地理距离上提供期望的文件系统语义和工具(如线性化操作、分层访问控制、标准命令行工具等)的困难,这些
妙BOOK言
·
2024-01-25 14:02
论文阅读
论文阅读
元数据
Flink1.17总结
1.Flink介绍1.Flink和
Spark
Streaming区别2.Flink分层API3.WordCount案例需求:写一个文本,统计出单词的个数1.使用flink批处理查看WordCountBatchDemo
asxyyjh
·
2024-01-25 14:29
大数据
flink
java
【易混区分】 tensor张量 Numpy张量的各种矩阵乘法、点积的函数对比 (dot, multiply,*,@matmul)
文章目录1矩阵运算基本概念1.1点积1.2矩阵乘法2dot()3multiply()和*4matmul和@1矩阵运算基本概念1.1点积又称为数量积、标量积(
scala
rproduct)或者内积(innerproduct
Qodicat
·
2024-01-25 13:16
Python学习
numpy
矩阵
线性代数
FlinkAPI开发之FlinkSQL
org.apache.flinkflink-table-api-java-bridge${flink.version}这里的依赖是一个Java的“桥接器”(bridge),主要就是负责TableAPI和下层DataStreamAPI的连接支持,按照不同的语言分为Java版和
Scala
Appreciate(欣赏)
·
2024-01-25 11:27
Flink
java
java
flink
大数据
【hudi学习笔记】hudi基础教程-hudi表设计
一.hudi表设计在较高的层次上,用于写Hudi表的组件使用了一种受支持的方式嵌入到Apache
Spark
作业中,它会在支持DFS的存储上生成代表Hudi表的一组文件。
菜鸟老胡~
·
2024-01-25 09:13
技术学习
big
data
数据仓库
大数据
Hudi学习笔记4 - Hudi配置之
Spark
配置
Spark
DatasourceConfigs读配置配置项是否必须默认值配置说明as.of.instantYN/A0.9.0版本新增,时间旅行查询从哪儿开始,有两种格式的值:yyyyMMddHHmmss和
一见
·
2024-01-25 09:40
hudi
spark
spark
学习
笔记
Hudi学习笔记2 - Hudi配置
https://hudi.apache.org/docs/configurationsHudi配置分类
Spark
DatasourceConfigs
Spark
Datasource的配置。
一见
·
2024-01-25 09:39
flink
hudi
spark
学习
笔记
大数据
Hudi学习笔记1
使用
Spark
SQL创建hudi表时,默认设置:hoodie.da
一见
·
2024-01-25 09:09
hudi
flink
spark
学习
笔记
hive
Hudi学习笔记(一)
大数据发展背景Hudi用于管理分布式文件系统上大型分析数据集存储,支持
Spark
和Flink整合。它能够是DFS数据集在分钟级时延内支持变更,也支持下游系统对这个数据集的增量处理。
一一|一一一亅
·
2024-01-25 09:37
学习
笔记
上万字详解
Spark
Core(建议收藏)
先来一个问题,也是面试中常问的:
Spark
为什么会流行?
废柴程序员
·
2024-01-25 09:06
【零碎知识】pip install 与 conda install 的区别
conda是一个跨平台的包管理和环境管理系统,可以用于安装Python软件包以及其他语言(如R,
Scala
等)的包。它是为Anaconda发行版特别设计的,但也可以在Miniconda中单独
同学小张
·
2024-01-25 09:25
python
pip
conda
python
经验分享
笔记
Hadoop-MapReduce-跟着日志理解整体流程
数据准备viinput_01.txtviinput_02.txtviinput_03.txt文本内容如下:-----------------input_01.txt----------------java
scala
pythonc
隔着天花板看星星
·
2024-01-25 09:49
hadoop
mapreduce
大数据
spark
3.2 reuse pvc 功能改造
背景
spark
reusepvcfeaturePVC:PersistentVolumeClaim.APersistentVolumeClaim(PVC)isarequestforstoragebyauser.ItissimilartoaPod.PodsconsumenoderesourcesandPVCsconsumePVresources.Podscanrequestspecificlevelso
todd5167
·
2024-01-25 07:23
大数据平台组件日常运维操作说明(Hadoop/Zookeeper/Kafa/ES/Mysql/
Spark
/Flume/Logstash/Tomcat)
Hadoop日常运维操作说明hdfs生产环境hadoop为30台服务器组成的集群,统一安装配置,版本号为2.7.7部署路径:/opt/hadoop启动用户:hadoop配置文件:/opt/hadoop/config/hdfs-site.xml/opt/hadoop/config/core-site.xmlhadoopy运行环境变量配置文件:hadoop-env.shjournalnode.envd
love6a6
·
2024-01-25 07:12
大数据
java-zookeeper
运维
一个女人和一座公园
图片发自App后来知道这座公园有一个很阴柔的名字“Women‘
sPark
”。鉴于这是所知范围内最近的公园,所以似乎也没有更好的选择。于是这名孕妇经常踟蹰在这异国他乡清
七月的薰衣草天空
·
2024-01-25 07:13
【Java Kubernates】Java调用kubernates提交Yaml到
Spark
Operator
考虑使用
spark
,
spark
operator也已经部署到k8s,现在需要定向提交
spark
sql到k8s的
spark
operator上,使用k8s资源执行sql。
秦拿希
·
2024-01-25 07:13
java
k8s
spark
operator
fabric8io
spark
广播变量
-1-24广播变量特点BroadcastVariable会将使用到的变量,只会为每个节点拷贝一份,不会为每个task进行拷贝,能够优化性能(在task数量比较大体现更明显),减少网络传输及内存消耗通过
Spark
Context
新鲜氧气
·
2024-01-25 07:37
spark
大数据
分布式
天津大数据培训班推荐,数据分析过程的常见错误
大数据就业方向大数据开发方向:掌握Java、Python、
Scala
等开发语言,以及关系型与非关系
qq_38453958
·
2024-01-25 06:57
大数据培训
天津大数据培训
天津大数据培训班
天津大数据培训机构
天津大数据培训学校
大数据培训
Scala
基础知识
scala
1、
scala
简介
scala
是运行在JVM上的多范式编程语言,同时支持面向对象和面向函数式编程。
坐在风口上de猪
·
2024-01-25 06:48
scala
开发语言
后端
starrocks3.0 编写自定义UDF java/
scala
版本 clickhouse中countResample
文章主线通过自定义UDAF实现clickhouse中的内置函数countResample官方文档JavaUDF|StarRocksUDFjava
scala
都可以UDAFjava可以
scala
一直报错类找不到实际上类在的
Thomas2143
·
2024-01-25 06:35
总结
scala
开发语言
后端
Spark
Streaming稽查布控/动态广播变量(处理电信数据)
Spark
Streaming稽查布控/动态广播变量需求:1.在mysql中建表2.在虚拟机中使用指令:nc-lk88883.在IDEA中编写代码数据如下需求:1.在mysql中建表CREATETABLE
莫尼莫尼
·
2024-01-25 05:54
大数据
spark
big
data
scala
py
spark
udf
目录简单的注册UDF自己定义函数UDFpy
spark
udf源码解析复杂数据类型:ArrayType、MapType、StructTypeArrayTypeMapTypeStructType简单的注册UDF
小赵要加油
·
2024-01-25 05:33
spark
spark
【
spark
】
Spark
SQL
目录
Spark
SQL01.快速入门什么是
Spark
SQL为什么学习
Spark
SQL
Spark
SQL的特点
Spark
SQL发展历史-前身Shark框架
Spark
SQL发展历史02.
Spark
SQL概述
Spark
SQL
小赵要加油
·
2024-01-25 05:00
spark
spark
大数据
分布式
Spark
难点 | Join的实现原理
Join背景当前
Spark
SQL支持三种join算法:ShuffleHashJoin、BroadcastHashJoin以及SortMergeJoin。
王知无
·
2024-01-25 03:35
jemalloc linux快速上手
我们看看作者自己的介绍:jemallocisageneralpurposemalloc(3)implementationthatemphasizesfragmentationavoidanceand
scala
bleconcurrencysupport
weixin_41772366
·
2024-01-25 00:26
clang
大数据开发之
Spark
(累加器、广播变量、Top10热门品类实战)
1、累加器使用1)累加器定义(
spark
context.accumulator(in
Key-Key
·
2024-01-25 00:25
大数据
spark
分布式
大数据开发之
Spark
SQL
第1章:
spark
sql概述1.1什么是
spark
sql1、
spark
sql是
spark
用于结构化数据处理的
spark
模块1)半结构化数据(日志数据)2)结构化数据(数据库数据)1.2为什么要有
spark
sqlhiveon
spark
Key-Key
·
2024-01-25 00:24
大数据
hadoop
请手动写出wordcount的
spark
代码实现
valconf=new
Spark
Conf().setMaster("local[6]").setAppName("wordCount")valsc=new
Spark
Context(conf)sc.textFile
scott_alpha
·
2024-01-24 23:28
js快速计算文件hash值
1.通过requestIdleCallbackor
spark
-md5利用浏览器空闲时间切片计算文件hash值:requestIdleCallback简介:window.requestIdleCallback
舜岳
·
2024-01-24 22:01
vue
js设计模式
javascript
hash
spark-md5
Worker
【无标题】
Github:https://github.com/
Spark
DevNetwork/Rock详细介绍:点击查看145、用于自动化测试Windows应用程序的开
sophiemantela
·
2024-01-24 21:15
c#
学习笔记
.net
开源
Spark
基本架构及原理
Hadoop和
Spark
的关系
Spark
运算比Hadoop的MapReduce框架快的原因是因为Hadoop在一次MapReduce运算之后,会将数据的运算结果从内存写入到磁盘中,第二次Mapredue
李飞_fd28
·
2024-01-24 20:50
最新AI系统ChatGPT网站H5系统源码,支持Midjourney绘画,GPT语音对话+ChatFile文档对话总结+DALL-E3文生图
一、前言
Spark
Ai创作系统是基于ChatGPT进行开发的Ai智能问答系统和Midjourney绘画系统,支持OpenAI-GPT全模型+国内AI全模型。
白云如幻
·
2024-01-24 17:09
ChatGPT
人工智能
软件源码
人工智能
chatgpt
语音识别
midjourney
AI作画
Spark
性能优化指南数据倾斜——高级篇
继基础篇讲解了每个
Spark
开发人员都必须熟知的开发调优与资源调优之后,本文作为《
Spark
性能优化指南》的高级篇,将深入分析数据倾斜调优与shuffle调优,以解决更加棘手的性能问题。
吃胖点儿
·
2024-01-24 17:15
spark核心技术
Spark
源码之CacheManager
Spark
源码之CacheManager篇CacheManager介绍1.CacheManager管理
spark
的缓存,而缓存可以基于内存的缓存,也可以是基于磁盘的缓存;2.CacheManager需要通过
小狼星I
·
2024-01-24 12:38
Hudi0.14.0 集成
Spark
3.2.3(IDEA编码方式)
本次在IDEA下使用
Scala
语言进行开发,具体环境搭建查看文章IDEA下
Scala
Maven开发环境搭建。
跟着大数据和AI去旅行
·
2024-01-24 11:46
大数据企业级实战
hudi
Hudi0.14.0集成
Spark
3.2.3(
Spark
Shell方式)
1启动1.1启动
Spark
Shell#For
Spark
versions:3.2-3.4
spark
-shell--jars/path/to/jars/hudi-
spark
3.2-bundle_2.12-0.14.0
跟着大数据和AI去旅行
·
2024-01-24 08:11
大数据企业级实战
hudi
Hudi0.14.0集成
Spark
3.2.3(
Spark
SQL方式)
1整合HiveForuserswhohave
Spark
-Hiveintegrationintheirenvironment,thisguideassumesthatyouhavetheappropriatesettingsconfiguredtoallow
Spark
tocreatetablesandregisterinHiveMetastore
跟着大数据和AI去旅行
·
2024-01-24 08:05
大数据企业级实战
hudi
学习
Spark
遇到的问题
【报错】AttributeError:‘
Spark
Context’objecthasnoattribute‘setcheckpointDir’本人传参:conf=
Spark
Conf().setAppName
黄黄黄黄黄莹
·
2024-01-24 07:20
spark
Spark
详解(八):
Spark
容错以及高可用性HA
1.Executor容错
Spark
支持多种运行模式,这些运行模型中的集群管理器会为任务分配运行资源,在运行资源中启动Executor,由Ex
MasterT-J
·
2024-01-24 07:19
Spark框架
Spark框架
Spark框架
Spark
DataFrame:从底层逻辑到应用场景的深入解析
本文将深入探讨
Spark
DataFrame的底层逻辑、发展由来以及应用场景。通过了解DataFrame的底层逻辑,我们可以更好地理解其在
Spark
中的重要地位。
{BOOLEAN}
·
2024-01-24 07:18
spark
大数据
分布式
Apache
Spark
中的广播变量分发机制
Apache
Spark
中的广播变量提供了一种机制,允许用户在集群中共享只读变量,并且每个任务都可以访问这个变量,而不需要在每次任务之间重新发送该变量。
{BOOLEAN}
·
2024-01-24 07:18
spark
大数据
分布式
大数据开发之
Spark
(RDD弹性分布式数据集)
第1章:rdd概述1.1什么是rddrdd(resilientdistributeddataset)叫做弹性分布式数据集,是
spark
中最基本的数据抽象。
Key-Key
·
2024-01-24 07:17
大数据
分布式
spark
弹性分布式数据集
深入理解
Spark
编程中的map方法
在
Spark
的上下文
{BOOLEAN}
·
2024-01-24 07:47
spark
大数据
分布式
Spark
运行架构以及容错机制
Spark
运行架构以及容错机制1.
Spark
的角色区分1.1Driver1.2Excuter2.
Spark
-Cluster模式的任务提交流程2.1
Spark
OnYarn的任务提交流程2.1.1yarn相关概念
李姓门徒
·
2024-01-24 07:41
大数据
Spark
spark
架构
java
spark
-flink设计思想之吸星大法-1
Spark
和Flink都是大数据处理框架,它们的设计思想有一些不同之处。以下是对它们设计思想的简要对比:数据模型和计算模型:
Spark
:
Spark
使用弹性分布式数据集(RDD)作为其核心数据结构。
{BOOLEAN}
·
2024-01-24 07:47
spark
flink
大数据
reduceByKey应用举例
PhotobyStefanStefancikfromPexels在进行
Spark
开发算法时,最有用的一个函数就是reduceByKey。
学习之术
·
2024-01-24 05:16
Spark
- 动态注册UDF
>昨天有位大哥问小弟一个
Spark
问题,他们想在不停
Spark
程序的情况下动态更新UDF的逻辑,他一问我这个问题的时候,本猪心里一惊,
Spark
**还能这么玩?
kikiki4
·
2024-01-24 03:22
Spark
编程模型 RDD
Spark
编程模型有两个主要的抽象,第一个是弹性数据集RDD(ResilientDistributedDataset),第二个是共享变量:广播变量和累加器。首先了解以下RDD。
Alex90
·
2024-01-23 23:44
Scala
-11.方法
和Java的不同:指定方法的访问控制(可见性):默认是public,和Java相比,
Scala
提供了更细粒度的作用域控制:对象私有作用域(Object-private),只有当前对象的实例可见,用private
悠扬前奏
·
2024-01-23 19:33
Grafana panel之Singlestat
它还可以将单个数字转换为文本值,并显示该时间序列的
spark
line摘要。在Grafana7.0中已将Stat面板代替Singlestat。但由于我用的还是老版的grafana所以还是决定
jeongee0328
·
2024-01-23 19:15
上一页
43
44
45
46
47
48
49
50
下一页
按字母分类:
A
B
C
D
E
F
G
H
I
J
K
L
M
N
O
P
Q
R
S
T
U
V
W
X
Y
Z
其他