第 9 篇:「Fluss 运维实战」—— 部署、监控与故障排查 第 9 篇「Fluss 运维实战」—— 部署、监控与故障排查阅读本文你将了解Fluss 的三种部署方式、Kubernetes Helm Chart 部署、Prometheus Grafana 监控配置、日常运维操作扩缩容、备份恢复以及 Top 10 常见故障排查手册。9.1 部署方式9.1.1 Docker Compose开发/测试# docker-compose.ymlversion:3.8services:zookeeper:image:zookeeper:3.9ports:-2181:2181environment:ZOO_MY_ID:1ZOO_SERVERS:server.1zookeeper:2888:3888;2181volumes:-zk_data:/data-zk_log:/datalogcoordinator-server:image:apache/fluss:0.9.1command:coordinatorServerdepends_on:-zookeeperports:-9123:9123environment:ZOOKEEPER_ADDRESS:zookeeper:2181COORDINATOR_HOST:coordinator-serverCOORDINATOR_PORT:9123volumes:-coordinator_data:/datatablet-server-1:image:apache/fluss:0.9.1command:tabletServerdepends_on:-coordinator-serverenvironment:ZOOKEEPER_ADDRESS:zookeeper:2181TABLET_SERVER_HOST:tablet-server-1DATA_DIR:/data/tabletvolumes:-ts1_data:/datatablet-server-2:image:apache/fluss:0.9.1command:tabletServerdepends_on:-coordinator-serverenvironment:ZOOKEEPER_ADDRESS:zookeeper:2181TABLET_SERVER_HOST:tablet-server-2DATA_DIR:/data/tabletvolumes:-ts2_data:/datavolumes:zk_data:zk_log:coordinator_data:ts1_data:ts2_data:9.1.2 KubernetesHelm Chart# 添加 Fluss Helm Repositoryhelm repoaddfluss https://apache.github.io/fluss/ helm repo update# 安装 Fluss 集群helminstallfluss-cluster fluss/fluss\--namespacefluss\--create-namespace\--setcoordinator.replicas3\--settabletServer.replicas6\--settabletServer.resources.requests.memory16Gi\--settabletServer.resources.requests.cpu4\--setpersistence.size500Gi\--setzookeeper.enabledfalse\--sets3.endpointhttps://s3.amazonaws.com\--sets3.bucketmy-fluss-bucketHelm values 关键配置# values.yaml (关键部分)coordinator:replicas:3# 高可用3 个 Coordinatorresources:requests:memory:8Gicpu:2limits:memory:16Gicpu:4tabletServer:replicas:6resources:requests:memory:32Gi# TabletServer 需要较大内存cpu:8persistence:size:1Ti# 本地 SSD 用于 Hot Tierconfig:# JVM 配置heapSize:28gdirectMemorySize:4g# Arrow 使用堆外内存# RocksDB 配置kvStoreBlockCacheSize:8gkvStoreWriteBufferSize:256m9.1.3 裸机部署# 下载 Flusswgethttps://dlcdn.apache.org/fluss/0.9.1/fluss-0.9.1-bin.tar.gztar-xzffluss-0.9.1-bin.tar.gzcdfluss-0.9.1# 配置 conf/fluss-conf.yamlcatconf/fluss-conf.yamlEOF # ZooKeeper zookeeper.address: zk1:2181,zk2:2181,zk3:2181 # Coordinator coordinator.host: coord-1 coordinator.port: 9123 # TabletServer tablet.server.host: ts-1 data.dir: /data/fluss # 远程存储S3 remote.data.dir: s3://my-bucket/fluss/ s3.endpoint: https://s3.amazonaws.com s3.access-key: YOUR_KEY s3.secret-key: YOUR_SECRET # 日志 log.dir: /var/log/fluss EOF# 启动bin/fluss-coordinator.sh start bin/fluss-tablet-server.sh start# 验证bin/fluss-cluster.sh status9.2 集群关键配置参数9.2.1 CoordinatorServer 参数参数默认值推荐值说明coordinator.port91239123RPC 端口zookeeper.addresslocalhost:2181zk1:2181,zk2:2181ZK 地址zookeeper.session.timeout30000ms60000msZK 会话超时tablet.assignment.balance.interval300s300sRebalance 检查间隔coordinator.heap.size4g8g-16gJVM 堆大小9.2.2 TabletServer 参数参数默认值推荐值说明data.dir/tmp/fluss/data/fluss数据目录SSD推荐log.segment.size1GB1GB-4GBLog Segment 大小log.segment.retention.hours72h24h-72hSegment 保留时间kv.store.block.cache.size256MB4GB-16GBRocksDB Block Cachekv.store.write.buffer.size64MB128MB-256MB写缓冲区大小9.3 监控指标9.3.1 Fluss Metrics 架构Fluss 使用 fluss-metrics 模块暴露指标支持 Prometheus 格式 TabletServer 关键指标 ├── fluss_tablet_log_write_rate # 日志写入速率 (records/sec) ├── fluss_tablet_log_read_rate # 日志读取速率 ├── fluss_tablet_kv_put_rate # KV 写入速率 ├── fluss_tablet_kv_get_rate # KV 读取速率 ├── fluss_tablet_kv_get_latency_p99 # KV P99 延迟 ├── fluss_tablet_disk_usage_bytes # 磁盘使用量 ├── fluss_tablet_segment_count # Segment 数量 ├── fluss_tablet_active_connections # 活跃连接数 └── fluss_tablet_tiering_offset_lag # Tiering 延迟 CoordinatorServer 关键指标 ├── fluss_coordinator_active_tablets # 活跃 Tablet 数 ├── fluss_coordinator_under_replicated # 副本不足的 Tablet ├── fluss_coordinator_rebalance_count # Rebalance 次数 └── fluss_coordinator_request_latency # 请求延迟9.3.2 Prometheus 配置# prometheus.ymlscrape_configs:-job_name:fluss-coordinatorstatic_configs:-targets:[coord-1:9249,coord-2:9249,coord-3:9249]metrics_path:/metrics-job_name:fluss-tablet-serverstatic_configs:-targets:-ts-1:9250-ts-2:9250-ts-3:9250-ts-4:9250-ts-5:9250-ts-6:9250metrics_path:/metrics9.3.3 Grafana Dashboard关键告警规则# alerting_rules.ymlgroups:-name:fluss_alertsrules:-alert:TabletServerDownexpr:up{jobfluss-tablet-server} 0for:1mlabels:severity:criticalannotations:summary:TabletServer {{ $labels.instance }} is down-alert:HighKvLatencyexpr:fluss_tablet_kv_get_latency_p99100for:5mlabels:severity:warningannotations:summary:KvStore P99 latency 100ms on {{ $labels.instance }}-alert:DiskUsageHighexpr:fluss_tablet_disk_usage_bytes / fluss_tablet_disk_total_bytes0.85for:10mlabels:severity:warningannotations:summary:Disk usage 85% on {{ $labels.instance }}-alert:TieringLagexpr:fluss_tablet_tiering_offset_lag10000000for:15mlabels:severity:warningannotations:summary:Tiering lag 10M records on {{ $labels.instance }}9.4 Top 10 故障排查故障 1OOM内存溢出症状TabletServer 进程频繁重启日志中有 OutOfMemoryError 排查 1. 检查 JVM 堆配置bin/fluss-tablet-server.sh -Xmx? 2. 检查堆外内存Direct MemoryArrow RecordBatch 使用 Direct Memory 3. 检查 RocksDB Block Cache 大小 解决 # 增加 JVM 堆 export FLUSS_HEAP_OPTS-Xms16g -Xmx16g # 增加 Direct Memory export FLUSS_DIRECT_MEMORY-XX:MaxDirectMemorySize8g # 降低 Block Cache SET kv.store.block.cache.size 2g故障 2磁盘写满症状写入报错 No space left on device 排查 1. df -h 检查磁盘使用率 2. 检查 LogSegment 保留策略是否正确 3. 检查 Tiering 是否正常工作 解决 # 清理过期 Segment bin/fluss-cleanup.sh --older-than 24h # 或缩短保留时间 ALTER TABLE orders SET (log.segment.retention.hours 24); # 确保 Tiering 正常运行 # 查看 Tiering 延迟 curl http://coordinator:9249/metrics | grep tiering_offset_lag故障 3网络分区症状部分 TabletServer 不可达Leader 切换频繁 排查 1. ping/telnet 检查网络连通性 2. 检查 ZooKeeper 是否正常echo stat | nc zk 2181 3. 检查 Coordinator 日志中的连接超时 解决 # 增加网络超时 SET zookeeper.session.timeout 120000 # 重启受影响的 TabletServer bin/fluss-tablet-server.sh restart故障 4数据倾斜症状部分 TabletServer 负载过高I/O 和 CPU 不均衡 排查 1. 检查各 TabletServer 的 Tablet 数量分布 2. 检查热点 Bucket写入 QPS 最高的 Bucket 解决 # 增加 Bucket 数量 ALTER TABLE hot_table SET (bucket.num 64); # 触发手动 Rebalance bin/fluss-rebalance.sh --table hot_table故障 5Checkpoint 失败症状Flink 任务 Checkpoint 超时 排查 1. Flink UI 查看 Checkpoint 历史 2. Fluss 日志中是否有慢写入 解决 # 增加 Checkpoint 超时 env.enableCheckpointing(300000); // 5 分钟 # 减少 Flink 并行度或增加 Fluss TabletServer故障 6RocksDB Compaction 卡顿症状KvStore 写入延迟飙升 排查 1. 检查 RocksDB 日志中的 Compaction 统计 2. 检查是否触发了 Level 0 → Level 1 的大 Compaction 解决 # 增加写缓冲区 SET kv.store.write.buffer.size 256m SET kv.store.max.write.buffer.number 4 # 限制后台 Compaction 线程 SET kv.store.max.background.compactions 2故障 7ZooKeeper 连接超时症状CoordinatorServer 不断重连 ZooKeeper 解决 # 增加 ZK 超时 SET zookeeper.connection.timeout 30000 SET zookeeper.session.timeout 120000故障 8S3 上传失败症状Tiering Service 日志报 S3 错误 排查 1. 验证 S3 凭证是否过期 2. 检查网络是否可达 S3 endpoint 解决 # 更新凭证 SET s3.access-key NEW_KEY SET s3.secret-key NEW_SECRET # 使用 AssumeRole SET s3.credentials.provider STSAssumeRoleSessionCredentialsProvider SET s3.role.arn arn:aws:iam::123456789:role/FlussTieringRole故障 9Schema 不兼容症状写入报 Schema 错误 排查 1. 检查写入数据的 Schema 是否与表 Schema 匹配 2. 是否存在未知的新列 解决 # 添加缺失的列 ALTER TABLE my_table ADD COLUMN new_field STRING;故障 10Flink Connector 版本不匹配症状ClassNotFoundException 或 MethodNotFoundException 解决 # 确 Flink 与 Fluss 版本兼容 # Fluss 0.9.1 支持 Flink 1.18 / 1.19 / 1.20 / 2.2 dependency groupIdorg.apache.fluss/groupId artifactIdfluss-flink-${您的Flink主版本}/artifactId version0.9.1/version /dependency9.5 备份与恢复9.5.1 备份策略数据备份层次 Hot Tier (Fluss) ├── LogTablet通过 ISR 副本天然备份3 副本 └── KvTablet通过 WAL Remote Storage Snapshot 备份 Cold Tier (Iceberg/Paimon) └── Parquet 文件在 S3 上天然持久化 版本管理 Metadata (ZooKeeper) └── 定期备份 ZK 数据目录9.5.2 灾难恢复# 1. 恢复 ZooKeeper 元数据cp/backup/zookeeper/version-2/* /data/zookeeper/version-2/# 2. 启动新集群bin/fluss-coordinator.sh start bin/fluss-tablet-server.sh start# 3. 从 Remote Storage 恢复 KvStore# Fluss 自动检测本地缺失的 KvTablet 并从 Remote Storage 下载 Snapshot# 然后从 LogTablet 重放 WAL 恢复到最新状态# 4. 验证恢复bin/fluss-cluster.sh status bin/fluss-cluster.sh verify-tables9.6 总结与下一篇预告运维领域关键工具/参数部署Docker Compose、Helm Chart、裸机部署三种方式监控fluss-metrics → Prometheus → Grafana告警TabletServer Down、高延迟、磁盘满、Tiering 延迟故障排查10 大常见故障OOM、磁盘满、网络分区、数据倾斜等扩缩容ALTER TABLE bucket.num bin/fluss-rebalance.sh备份恢复ISR 副本 Remote Storage Snapshot WAL 重放下一篇也是最后一篇——我们将通过 5 个完整的生产级实战案例展示 Fluss 在电商大屏、特征存储、CDC 管道、风控系统、客户 360 等场景中的端到端解决方案。本文基于 Apache Fluss 0.9.1 运维实践。项目 GitHub: https://github.com/apache/fluss

相关新闻

最新新闻

nslookup命令使用说明

nslookup命令使用说明

个人建站,域名备案完成后,往往还要做域名解析服务,技术人员怎么能知道自己配置的DNS正确与否呢?NSLOOKUP查询域名信息的一个非常有用的命令,可以指定查询的类型,可以查到DNS记录的生存时间还可以指定使用哪…

2026/8/17 0:00:17
【原创唯一】基于SpringBoot+Vue的在线书店商城系统 课程设计/大作业/期末作业(源码+MySQL数据库+实验报告+PPT+远程部署)

【原创唯一】基于SpringBoot+Vue的在线书店商城系统 课程设计/大作业/期末作业(源码+MySQL数据库+实验报告+PPT+远程部署)

摘要 电子商务与移动支付的普及,线上购书已成为高校师生及社会公众获取图书的重要方式。传统线下书店在图书检索、库存查询、订单跟踪等方面存在信息分散、效率较低等问题。本文设计并实现了一套基于 B/S 架构的网上书店系统,采用前后端分离模式&#xf…

2026/8/17 0:00:17
飞书局域网文件传输实战:3种方案实现高速点对点传输

飞书局域网文件传输实战:3种方案实现高速点对点传输

1. 项目概述:为什么要在局域网内用飞书传文件? 飞书作为一款主流的协同办公套件,其核心功能是围绕云端协作设计的。无论是文档、表格还是文件,通常的分享逻辑都是“上传到云端 -> 生成链接 -> 分享给同事”。这个流程在互联…

2026/8/17 0:00:17
LabVIEW异步调用实战:解决界面卡顿与并行处理难题

LabVIEW异步调用实战:解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必经之路如果你在LabVIEW里写过稍微复杂点的程序,尤其是涉及到界面响应、多任务并行或者硬件IO等待,大概率会遇到一个头疼的问题:程序“卡”住了。前面板点不动,进度条不更新…

2026/8/17 0:00:17
LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

LabVIEW异步调用实战:从原理到生产者消费者模式,解决界面卡顿与并行处理难题

1. 项目概述:为什么异步调用是LabVIEW进阶的必修课? 如果你用LabVIEW做过稍微复杂点的项目,尤其是涉及界面响应、多任务并行或者硬件IO等待的场景,大概率遇到过这样的窘境:前面板点个按钮,整个程序就“卡死…

2026/8/17 0:00:17
在西门子 IoT2050 上创建 Python venv 完整指南

在西门子 IoT2050 上创建 Python venv 完整指南

一、为什么在 IoT2050 上必须用 venv? IoT2050 的示例镜像基于 Debian Linux。从 Debian 12(Python 3.11+) 开始,系统 Python 被视为关键系统组件: 如果 pip 随意写入 /usr/lib/python3.x,可能破坏 apt、系统工具和升级路径 因此 Debian 直接禁止 pip install xxx / pi…

2026/8/16 23:55:17