20赞

读取Amazon Kinesis Firehose流写入s3的数据

作者：135369一生真爱_890 | 2023-09-09 11:02

如何解决《读取AmazonKinesisFirehose流写入s3的数据》经验，为你挑选了2个好方法。

我正在写Kinesis Firehose流的记录,最终由Amazon Kinesis Firehose写入S3文件.

我的记录对象看起来像

ItemPurchase {
    String personId,
    String itemId
}

数据写入S3看起来像:

{"personId":"p-111","itemId":"i-111"}{"personId":"p-222","itemId":"i-222"}{"personId":"p-333","itemId":"i-333"}

没有COMMA分离.

像Json阵列一样没有启动支架

没有结束支持,如在Json阵列中

我想读取这些数据获取ItemPurchase对象的列表.

List purchases = getPurchasesFromS3(IOUtils.toString(s3ObjectContent))

读取此数据的正确方法是什么？

1> Tom Chapin..：

令我感到困惑的是，Amazon Firehose以这种方式将JSON消息转储到S3，并且不允许您设置分隔符或其他任何内容。

最终，我发现解决该问题的技巧是使用JSON raw_decode方法处理文本文件

这将允许您读取一堆串联的JSON记录，而它们之间没有任何分隔符。

Python代码：

import json

decoder = json.JSONDecoder()

with open('giant_kinesis_s3_text_file_with_concatenated_json_blobs.txt', 'r') as content_file:

    content = content_file.read()

    content_length = len(content)
    decode_index = 0

    while decode_index < content_length:
        try:
            obj, decode_index = decoder.raw_decode(content, decode_index)
            print("File index:", decode_index)
            print(obj)
        except JSONDecodeError as e:
            print("JSONDecodeError:", e)
            # Scan forward and keep trying to decode
            decode_index += 1

2> Xuehua Jiang..：

我也有同样的问题,这是我如何解决的.

将"} {"替换为"} \n {"

由"\n"分割的行.

input_json_rdd.map(lambda x : re.sub("}{", "}\n{", x, flags=re.UNICODE))
              .flatMap(lambda line: line.split("\n"))

嵌套的json对象有几个"}",因此用"}"分割线并不能解决问题.

我考虑过做类似的事情，但是我认为，如果JSON对象中的字符串之一恰好包含} {，那么该技术将会失效。也许，如果您遍历每个字符，如果您打了“”（表示输入或离开字符串），请切换一个布尔值，计算您所在的对象的级别（在字符串外部看到{时增加，在字符串外部看到}时减少字符串），然后将对象的末尾视为水平计数器再次达到0时。

推荐阅读

程序员
在data.table中找到匹配的行索引(我可以二进制搜索吗？)

如何解决《在data.table中找到匹配的行索引(我可以二进制搜索吗？)》经验，为你挑选了1个好方法。 ... [详细]
程序员
在没有窗口/ GUI的情况下运行Pygame

如何解决《在没有窗口/GUI的情况下运行Pygame》经验，为你挑选了1个好方法。 ... [详细]
程序员
clojure:没有利弊细胞

如何解决《clojure:没有利弊细胞》经验，为你挑选了3个好方法。 ... [详细]
程序员
为什么我不能从Java中的专用枚举值访问静态最终成员

如何解决《为什么我不能从Java中的专用枚举值访问静态最终成员》经验，为你挑选了1个好方法。 ... [详细]
程序员
获取已经加载的DLL的版本（Windows API）

如何解决《获取已经加载的DLL的版本（WindowsAPI）》经验，为你挑选了1个好方法。 ... [详细]
程序员
行绑定Julia数据帧

如何解决《行绑定Julia数据帧》经验，为你挑选了1个好方法。 ... [详细]
程序员
Object.assign保持对原始对象的引用

如何解决《Object.assign保持对原始对象的引用》经验，为你挑选了0个好方法。 ... [详细]
程序员
Go - 不呈现HTML注释

如何解决《Go-不呈现HTML注释》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用jQuery 2.1+更改css会忽略transition属性

如何解决《使用jQuery2.1+更改css会忽略transition属性》经验，为你挑选了0个好方法。 ... [详细]
程序员
异常错误:访问冲突读取位置0xDDDDDDDD

如何解决《异常错误:访问冲突读取位置0xDDDDDDDD》经验，为你挑选了1个好方法。 ... [详细]
程序员
提交的Ajax复选框可以防止点击发布/提交

如何解决《提交的Ajax复选框可以防止点击发布/提交》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何查看PHP cURL请求主体（如CURLINFO_HEADER_OUT的标题）

如何解决《如何查看PHPcURL请求主体（如CURLINFO_HEADER_OUT的标题）》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何通过regedit更改蓝色堆栈2分辨率

如何解决《如何通过regedit更改蓝色堆栈2分辨率》经验，为你挑选了0个好方法。 ... [详细]
程序员
跟踪胜利岩石剪刀

如何解决《跟踪胜利岩石剪刀》经验，为你挑选了0个好方法。 ... [详细]
程序员
在一组日期中查找时间空间

如何解决《在一组日期中查找时间空间》经验，为你挑选了0个好方法。 ... [详细]
程序员
反应条件渲染模式

如何解决《反应条件渲染模式》经验，为你挑选了1个好方法。 ... [详细]
程序员
Spark:为每个节点创建多个执行程序的优势是什么？

如何解决《Spark:为每个节点创建多个执行程序的优势是什么？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在C中连续唤醒并暂停500ms

如何解决《如何在C中连续唤醒并暂停500ms》经验，为你挑选了0个好方法。 ... [详细]
程序员
用于连字符的正则表达式

如何解决《用于连字符的正则表达式》经验，为你挑选了1个好方法。 ... [详细]
程序员
ffmpeg退出代码1:配置复杂过滤器时出错

如何解决《ffmpeg退出代码1:配置复杂过滤器时出错》经验，为你挑选了0个好方法。 ... [详细]

135369一生真爱_890

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章