当前位置:网站首页>mq消息积压怎么对应
mq消息积压怎么对应
2022-08-04 18:15:00 【zhangkaixuan456】
1、面试题
如何解决消息队列的延时以及过期失效问题?消息队列满了以后该怎么处理?有几百万消息持续积压几小时,说说怎么解决?
2、面试官心里分析
你看这问法,其实本质针对的场景,都是说,可能你的消费端出了问题,不消费了,或者消费的极其极其慢。接着就坑爹了,可能你的消息队列集群的磁盘都快写满了,都没人消费,这个时候怎么办?或者是整个这就积压了几个小时,你这个时候怎么办?或者是你积压的时间太长了,导致比如rabbitmq设置了消息过期时间后就没了怎么办?
所以就这事儿,其实线上挺常见的,一般不出,一出就是大case,一般常见于,举个例子,消费端每次消费之后要写mysql,结果mysql挂了,消费端hang那儿了,不动了。或者是消费端出了个什么叉子,导致消费速度极其慢。
3、面试题分析
关于这个事儿,我们一个一个来梳理吧,先假设一个场景,我们现在消费端出故障了,然后大量消息在mq里积压,现在事故了,慌了
(1)大量消息在mq里积压了几个小时了还没解决
几千万条数据在MQ里积压了七八个小时,从下午4点多,积压到了晚上很晚,10点多,11点多
这个是我们真实遇到过的一个场景,确实是线上故障了,这个时候要不然就是修复consumer的问题,让他恢复消费速度,然后傻傻的等待几个小时消费完毕。这个肯定不能在面试的时候说吧。
一个消费者一秒是1000条,一秒3个消费者是3000条,一分钟是18万条,1000多万条
所以如果你积压了几百万到上千万的数据,即使消费者恢复了,也需要大概1小时的时间才能恢复过来
一般这个时候,只能操作临时紧急扩容了,具体操作步骤和思路如下:
1)先修复consumer的问题,确保其恢复消费速度,然后将现有cnosumer都停掉
2)新建一个topic,partition是原来的10倍,临时建立好原先10倍或者20倍的queue数量
3)然后写一个临时的分发数据的consumer程序,这个程序部署上去消费积压的数据,消费之后不做耗时的处理,直接均匀轮询写入临时建立好的10倍数量的queue
4)接着临时征用10倍的机器来部署consumer,每一批consumer消费一个临时queue的数据
5)这种做法相当于是临时将queue资源和consumer资源扩大10倍,以正常的10倍速度来消费数据
6)等快速消费完积压数据之后,得恢复原先部署架构,重新用原先的consumer机器来消费消息
(2)这里我们假设再来第二个坑
假设你用的是rabbitmq,rabbitmq是可以设置过期时间的,就是TTL,如果消息在queue中积压超过一定的时间就会被rabbitmq给清理掉,这个数据就没了。那这就是第二个坑了。这就不是说数据会大量积压在mq里,而是大量的数据会直接搞丢。
这个情况下,就不是说要增加consumer消费积压的消息,因为实际上没啥积压,而是丢了大量的消息。我们可以采取一个方案,就是批量重导,这个我们之前线上也有类似的场景干过。就是大量积压的时候,我们当时就直接丢弃数据了,然后等过了高峰期以后,比如大家一起喝咖啡熬夜到晚上12点以后,用户都睡觉了。
这个时候我们就开始写程序,将丢失的那批数据,写个临时程序,一点一点的查出来,然后重新灌入mq里面去,把白天丢的数据给他补回来。也只能是这样了。
假设1万个订单积压在mq里面,没有处理,其中1000个订单都丢了,你只能手动写程序把那1000个订单给查出来,手动发到mq里去再补一次
(3)然后我们再来假设第三个坑
如果走的方式是消息积压在mq里,那么如果你很长时间都没处理掉,此时导致mq都快写满了,咋办?这个还有别的办法吗?没有,谁让你第一个方案执行的太慢了,你临时写程序,接入数据来消费,消费一个丢弃一个,都不要了,快速消费掉所有的消息。然后走第二个方案,到了晚上再补数据吧。
边栏推荐
猜你喜欢
EasyCVR本地接入国标设备映射公网后,本地设备出现无法播放与级联的解决方法
如何进行自动化测试?
Hezhou Cat1 4G module Air724UG is configured with RNDIS network card or PPP dial-up, and the development board is connected to the Internet through the RNDIS network card (taking the RV1126/1109 devel
A group of friends asked for help, but the needs that were not solved in a week were solved in 3 minutes?
Documentary on Security Reinforcement of Network Range Monitoring System (1)—SSL/TLS Encrypted Transmission of Log Data
使用scikit-learn计算文本TF-IDF值
About the two architectures of ETL (ETL architecture and ELT architecture)
YOLOv7-Pose尝鲜,基于YOLOv7的关键点模型测评
Matlab画图1
Thrift IDL示例文件
随机推荐
网站设计师:Nicepage 4.15 Crack By Xacker
火灾报警联网FC18中CAN光端机常见问题解答和使用指导
OpenInfra Days China 2022|SelectDB与你共享 Apache Doris 在互联网广告业务中的实践
Develop those things: How to obtain the traffic statistics of the monitoring site through the EasyCVR platform?
"No title"
语音识别学习资源
谁能解答?从mysql的binlog读取数据到kafka,但是数据类型有Insert,updata,
EasyCVR calls the cloud recording API and returns an error and no recording file is generated. What is the reason?
Google Earth Engine APP - one-click online viewing of global images from 1984 to this year and loading an image analysis at the same time
不论你是大众,科班和非科班,我这边整理很久,总结出的学习路线,还不快卷起来
Enterprise survey correlation analysis case
全球电子产品需求放缓:三星越南工厂大幅压缩产能
合宙Cat1 4G模块Air724UG配置RNDIS网卡或PPP拨号,通过RNDIS网卡使开发板上网(以RV1126/1109开发板为例)
从-99打造Sentinel高可用集群限流中间件
关于大学生内卷的文献综述
关于ETL的两种架构(ETL架构和ELT架构)
Flask framework implementations registered encryption, a Flask enterprise class learning 】 【
EasyCVR调用云端录像API接口返回错误且无录像文件生成,是什么原因?
【web自动化测试】Playwright快速入门,5分钟上手
dotnet core 使用 CoreRT 将程序编译为 Native 程序