当前位置:网站首页>mq消息积压怎么对应
mq消息积压怎么对应
2022-08-04 18:15:00 【zhangkaixuan456】
1、面试题
如何解决消息队列的延时以及过期失效问题?消息队列满了以后该怎么处理?有几百万消息持续积压几小时,说说怎么解决?
2、面试官心里分析
你看这问法,其实本质针对的场景,都是说,可能你的消费端出了问题,不消费了,或者消费的极其极其慢。接着就坑爹了,可能你的消息队列集群的磁盘都快写满了,都没人消费,这个时候怎么办?或者是整个这就积压了几个小时,你这个时候怎么办?或者是你积压的时间太长了,导致比如rabbitmq设置了消息过期时间后就没了怎么办?
所以就这事儿,其实线上挺常见的,一般不出,一出就是大case,一般常见于,举个例子,消费端每次消费之后要写mysql,结果mysql挂了,消费端hang那儿了,不动了。或者是消费端出了个什么叉子,导致消费速度极其慢。
3、面试题分析
关于这个事儿,我们一个一个来梳理吧,先假设一个场景,我们现在消费端出故障了,然后大量消息在mq里积压,现在事故了,慌了
(1)大量消息在mq里积压了几个小时了还没解决
几千万条数据在MQ里积压了七八个小时,从下午4点多,积压到了晚上很晚,10点多,11点多
这个是我们真实遇到过的一个场景,确实是线上故障了,这个时候要不然就是修复consumer的问题,让他恢复消费速度,然后傻傻的等待几个小时消费完毕。这个肯定不能在面试的时候说吧。
一个消费者一秒是1000条,一秒3个消费者是3000条,一分钟是18万条,1000多万条
所以如果你积压了几百万到上千万的数据,即使消费者恢复了,也需要大概1小时的时间才能恢复过来
一般这个时候,只能操作临时紧急扩容了,具体操作步骤和思路如下:
1)先修复consumer的问题,确保其恢复消费速度,然后将现有cnosumer都停掉
2)新建一个topic,partition是原来的10倍,临时建立好原先10倍或者20倍的queue数量
3)然后写一个临时的分发数据的consumer程序,这个程序部署上去消费积压的数据,消费之后不做耗时的处理,直接均匀轮询写入临时建立好的10倍数量的queue
4)接着临时征用10倍的机器来部署consumer,每一批consumer消费一个临时queue的数据
5)这种做法相当于是临时将queue资源和consumer资源扩大10倍,以正常的10倍速度来消费数据
6)等快速消费完积压数据之后,得恢复原先部署架构,重新用原先的consumer机器来消费消息
(2)这里我们假设再来第二个坑
假设你用的是rabbitmq,rabbitmq是可以设置过期时间的,就是TTL,如果消息在queue中积压超过一定的时间就会被rabbitmq给清理掉,这个数据就没了。那这就是第二个坑了。这就不是说数据会大量积压在mq里,而是大量的数据会直接搞丢。
这个情况下,就不是说要增加consumer消费积压的消息,因为实际上没啥积压,而是丢了大量的消息。我们可以采取一个方案,就是批量重导,这个我们之前线上也有类似的场景干过。就是大量积压的时候,我们当时就直接丢弃数据了,然后等过了高峰期以后,比如大家一起喝咖啡熬夜到晚上12点以后,用户都睡觉了。
这个时候我们就开始写程序,将丢失的那批数据,写个临时程序,一点一点的查出来,然后重新灌入mq里面去,把白天丢的数据给他补回来。也只能是这样了。
假设1万个订单积压在mq里面,没有处理,其中1000个订单都丢了,你只能手动写程序把那1000个订单给查出来,手动发到mq里去再补一次
(3)然后我们再来假设第三个坑
如果走的方式是消息积压在mq里,那么如果你很长时间都没处理掉,此时导致mq都快写满了,咋办?这个还有别的办法吗?没有,谁让你第一个方案执行的太慢了,你临时写程序,接入数据来消费,消费一个丢弃一个,都不要了,快速消费掉所有的消息。然后走第二个方案,到了晚上再补数据吧。
边栏推荐
- 企业即时通讯软件有哪些功能?对企业有什么帮助?
- Short-term reliability and economic evaluation of resilient microgrids under incentive-based demand response programs (Matlab code implementation)
- 悦刻难回巅峰
- ptables基本语法使用规则
- 什么是网站监控,网站监控软件有什么用?
- "No title"
- 【注册荣耀开发者】赢【荣耀70】手机
- EasyCVR如何通过接口调用设备录像的倍速回放?
- 数据库SqlServer迁移PostgreSql实践
- asp dotnet core 通过图片统计 csdn 用户访问
猜你喜欢

电源测试系统-ATE电源测试系统-ACDC电源模块测试系统NSAT-8000

开发那些事儿:如何通过EasyCVR平台获取监控现场的人流量统计数据?

巴比特 | 元宇宙每日必读:微博动漫将招募全球各类虚拟偶像并为其提供扶持...

PT100铂热电阻三种测温方法介绍

DHCP&OSPF组合实验演示(Huawei路由交换设备配置)

Matlab drawing 1

Flask framework implementations registered encryption, a Flask enterprise class learning 】 【

YOLOv7-Pose尝鲜,基于YOLOv7的关键点模型测评

Thrift IDL示例文件

图解LeetCode——899. 有序队列(难度:困难)
随机推荐
防火墙基础之防火墙做出口设备安全防护
图解LeetCode——899. 有序队列(难度:困难)
【软件工程之美 - 专栏笔记】37 | 遇到线上故障,你和高手的差距在哪里?
(ECCV-2022)GaitEdge:超越普通的端到端步态识别,提高实用性
基于 eBPF 的 Kubernetes 可观测实践
智能视频监控平台EasyCVR如何使用接口批量导出iframe地址?
Flask框架实现注册加密功能详解【Flask企业课学习】
buuctf(探险1)
容器化 | 在 NFS 备份恢复 RadonDB MySQL 集群数据
方法的重写
2022 May 1 Mathematical Modeling Question C Explanation
Google AppSheet: 无需编程构建零代码应用
情绪的波动起伏
ERC721标准与加密猫
哈夫曼树(暑假每日一题 15)
vantui 组件 van-field 路由切换时,字体样式混乱问题
数仓相关,总结
谷歌开源芯片 180 纳米制造工艺
解决错误:The package-lock.json file was created with an old version of npm
路由技术