使用sqoop往hdfs中导入数据供hive使用

sqoop import -fs hdfs://x.x.x.x:8020 -jt local --connect "jdbc:oracle:thin:@x.x.x.x:1521:testdb" --username user2 --password user2 --verbose --as-textfile --delete-target-dir -m 1 --query "select * from test_tb
where $CONDITIONS" --target-dir /tmp/test --null-string '\N' --null-non-string '\N' --fields-terminated-by ' 01' --lines-terminated-by ' 12' --hive-drop-import-delims

此语句将从oracle数据库中查出的内容放到指定的hdfs路径下，此时手动设置列换行符和行换行符，而不是使用 --hive-import 参数，是因为指定该参数之后它还会让你指定 --hive-table参数。而指定 --hive-import 和 --hive-table 之后，sqoop在将查询结果导入到hdfs中之后，会尝试调用执行sqoop的这台机器上的hive命令，然后执行建表语句以及 load data inpath 的语句将导入到hdfs中的内容移动到 hive对应的表的目录下。

但是如果hive开启了kerberos 认证，hive命令是没有权限操作hive的（记得是这样）。所以我们用以上语句只是将数据导入到hdfs中，后续的load data inpath 可以使用beeline等命令执行。而之所以指定 --hive-drop-import-delims，是因为从oracle中查出的值中可能包含hive默认的列分隔符和行分隔符，所以只能做出妥协，使用该参数将值中的列分隔符和行分隔符直接去掉。

列分隔符还好，列分隔符的ascii码是 001(八进制)，含义是SOH(start of headline)，是个不可见字符，平时文本处理时基本不会用到这个字符。但是行分隔符的ascii码是012(八进制)，含义是 line feed/new line，这个在平时处理文本时会经常遇到。

我们设想一种处理方式，那就是模仿csv文件，列分隔符就继续使用 01，行分隔符继续使用 12，如果值中有换行，就enclosed by double quote。但似乎看起来 hive的load data inpath 不支持这么高级的解析方式。关于csv的格式定义和hive的load data inpath 详细的处理方式待去查询对应的文档，此处只是提一下。

使用sqoop往hdfs中导入数据供hive使用

相关推荐