笔记记录,持续更新
Union操作和Union All操作
- Union :会对合并后的结果集进行去重操作,也就是会把重复的行去除,只保留其中一行
- 注意:使用Union时,同一个表的数据也会被去重
- Union All :不会进行去重操作 ,它会将所有查询结果集中的行全部保留(可存在重复的行)
- 特别注意:使用Union时,可能出现两个表Union后行数不如两个表分开统计行数的情况
凡事预则立,不预则废
查看文件的命令为:
1 | hadoop fs -ls |
可以用 Hadoop 的 fs 命令操作 HDFS(分布式文件系统),每个用户有一个默认的工作目录,通常为 /user/<用户名>
pwd 命令直接显示当前工作目录(hadoop fs -pwd)是会报错的查看当前用户的默认工作目录的方式
第一步:查看当前用户名
1 | whoami |
第二步:推断当前工作目录
/user/<用户名>hadoop-aipnlp,默认工作目录就是 /user/hadoop-aipnlp注:推荐始终使用绝对路径,避免因工作目录变化导致混淆
示例:
1 | hadoop fs -ls /user/hadoop-xxx/xxx |
hdfs dfs -put、hdfs dfs -appendToFile)修改文件内容时,NameNode 会协调 DataNode 同步更新所有副本cp, mkdir, rm 等命令都可以正常使用,且保证多个副本之间的一致性hadoop fs,hadoop dfs和hdfs dfs【注意没有hdfs fs】*hadoop fs、hadoop dfs 和 hdfs dfs 都是用于操作文件系统的命令,但它们的适用范围和历史背景有所不同hadoop fsfile:///、分布式文件系统如 S3 等)hdfs://、file:///),可以对对应的文件系统执行创建目录、上传文件、查看文件等操作hadoop fs 是官方更推荐的命令,适用于需要跨不同文件系统操作的场景hadoop dfshadoop dfs 逐渐被 hdfs dfs 取代,成为一个“历史遗留”的命令(实际执行时会映射到 hdfs dfs)hdfs dfshadoop dfs 完全一致,但更明确地指向 HDFShdfs 命令组(如 hdfs dfs、hdfs namenode 等),将 HDFS 相关操作与其他 Hadoop 功能(如 MapReduce)分离,使命令结构更清晰hdfs dfs 是更规范的选择hadoop fs,可操作多种文件系统hdfs dfs,功能明确且符合新版本规范hadoop dfs 已过时,不建议在新环境中使用put、get、ls 等)完全一致,区别主要在于适用范围和版本兼容性