日日操夜夜添-日日操影院-日日草夜夜操-日日干干-精品一区二区三区波多野结衣-精品一区二区三区高清免费不卡

公告:魔扣目錄網(wǎng)為廣大站長提供免費收錄網(wǎng)站服務(wù),提交前請做好本站友鏈:【 網(wǎng)站目錄:http://www.ylptlb.cn 】, 免友鏈快審服務(wù)(50元/站),

點擊這里在線咨詢客服
新站提交
  • 網(wǎng)站:51998
  • 待審:31
  • 小程序:12
  • 文章:1030137
  • 會員:747

作者:大數(shù)據(jù)之路 來源:https://my.oschina.net/leejun2005/blog/1602482

1、問題背景

 

昨天下午突然收到運維郵件報警,顯示數(shù)據(jù)平臺服務(wù)器cpu利用率達到了98.94%,而且最近一段時間一直持續(xù)在70%以上,看起來像是硬件資源到瓶頸需要擴容了,但仔細思考就會發(fā)現(xiàn)咱們的業(yè)務(wù)系統(tǒng)并不是一個高并發(fā)或者CPU密集型的應(yīng)用,這個利用率有點太夸張,硬件瓶頸應(yīng)該不會這么快就到了,一定是哪里的業(yè)務(wù)代碼邏輯有問題。

2、排查思路

 

2.1 定位高負載進程 pid

首先登錄到服務(wù)器使用top命令確認服務(wù)器的具體情況,根據(jù)具體情況再進行分析判斷。

 

CPU 100% 異常排查實踐與總結(jié)

 

 

通過觀察load average,以及負載評判標(biāo)準(8核),可以確認服務(wù)器存在負載較高的情況;

 

CPU 100% 異常排查實踐與總結(jié)

 

 

觀察各個進程資源使用情況,可以看出進程id為682的進程,有著較高的CPU占比

2.2 定位具體的異常業(yè)務(wù)

這里咱們可以使用 pwdx 命令根據(jù) pid 找到業(yè)務(wù)進程路徑,進而定位到負責(zé)人和項目:

 

CPU 100% 異常排查實踐與總結(jié)

 

 

可得出結(jié)論:該進程對應(yīng)的就是數(shù)據(jù)平臺的web服務(wù)。

2.3 定位異常線程及具體代碼行

傳統(tǒng)的方案一般是4步:

  1. top oder by with P:1040 // 首先按進程負載排序找到 maxLoad(pid)
  2. top -Hp 進程PID:1073 // 找到相關(guān)負載 線程PID
  3. printf “0x%xn”線程PID: 0x431 // 將線程PID轉(zhuǎn)換為 16進制,為后面查找 jstack 日志做準備
  4. jstack 進程PID | vim +/十六進制線程PID - // 例如:jstack 1040|vim +/0x431 -

 

但是對于線上問題定位來說,分秒必爭,上面的 4 步還是太繁瑣耗時了,之前介紹過淘寶的oldratlee 同學(xué)就將上面的流程封裝為了一個工具:show-busy-JAVA-threads.sh,可以很方便的定位線上的這類問題:

 

CPU 100% 異常排查實踐與總結(jié)

 

 

可得出結(jié)論:是系統(tǒng)中一個時間工具類方法的執(zhí)行cpu占比較高,定位到具體方法后,查看代碼邏輯是否存在性能問題。

※ 如果線上問題比較緊急,可以省略 2.1、2.2 直接執(zhí)行 2.3,這里從多角度剖析只是為了給大家呈現(xiàn)一個完整的分析思路。

3、根因分析

 

經(jīng)過前面的分析與排查,最終定位到一個時間工具類的問題,造成了服務(wù)器負載以及cpu使用率的過高。

  • 異常方法邏輯:是把時間戳轉(zhuǎn)成對應(yīng)的具體的日期時間格式;
  • 上層調(diào)用:計算當(dāng)天凌晨至當(dāng)前時間所有秒數(shù),轉(zhuǎn)化成對應(yīng)的格式放入到set中返回結(jié)果;
  • 邏輯層:對應(yīng)的是數(shù)據(jù)平臺實時報表的查詢邏輯,實時報表會按照固定的時間間隔來,并且在一次查詢中有多次(n次)方法調(diào)用。

 

那么可以得到結(jié)論,如果現(xiàn)在時間是當(dāng)天上午10點,一次查詢的計算次數(shù)就是 10*60*60*n次=36,000*n次計算,而且隨著時間增長,越接近午夜單次查詢次數(shù)會線性增加。由于實時查詢、實時報警等模塊大量的查詢請求都需要多次調(diào)用該方法,導(dǎo)致了大量CPU資源的占用與浪費。

4、解決方案

 

定位到問題之后,首先考慮是要減少計算次數(shù),優(yōu)化異常方法。排查后發(fā)現(xiàn),在邏輯層使用時,并沒有使用該方法返回的set集合中的內(nèi)容,而是簡單的用set的size數(shù)值。確認邏輯后,通過新方法簡化計算(當(dāng)前秒數(shù)-當(dāng)天凌晨的秒數(shù)),替換調(diào)用的方法,解決計算過多的問題。上線后觀察服務(wù)器負載和cpu使用率,對比異常時間段下降了30倍,恢復(fù)至正常狀態(tài),至此該問題得已解決。

 

CPU 100% 異常排查實踐與總結(jié)

 

 

5、總結(jié)

 

  • 在編碼的過程中,除了要實現(xiàn)業(yè)務(wù)的邏輯,也要注重代碼性能的優(yōu)化。一個業(yè)務(wù)需求,能實現(xiàn),和能實現(xiàn)的更高效、更優(yōu)雅其實是兩種截然不同的工程師能力和境界的體現(xiàn),而后者也是工程師的核心競爭力。
  • 在代碼編寫完成之后,多做 review,多思考是不是可以用更好的方式來實現(xiàn)。
  • 線上問題不放過任何一個小細節(jié)!細節(jié)是魔鬼,技術(shù)的同學(xué)需要有刨根問題的求知欲和追求卓越的精神,只有這樣,才能不斷的成長和提升。

 

Reference:

 

[1] 線上服務(wù) CPU 100%?一鍵定位 so easy!

https://my.oschina.net/leejun2005/blog/1524687

[2] linux 系統(tǒng)監(jiān)控、診斷工具之 top 詳解

https://my.oschina.net/leejun2005/blog/157910

分享到:
標(biāo)簽:CPU
用戶無頭像

網(wǎng)友整理

注冊時間:

網(wǎng)站:5 個   小程序:0 個  文章:12 篇

  • 51998

    網(wǎng)站

  • 12

    小程序

  • 1030137

    文章

  • 747

    會員

趕快注冊賬號,推廣您的網(wǎng)站吧!
最新入駐小程序

數(shù)獨大挑戰(zhàn)2018-06-03

數(shù)獨一種數(shù)學(xué)游戲,玩家需要根據(jù)9

答題星2018-06-03

您可以通過答題星輕松地創(chuàng)建試卷

全階人生考試2018-06-03

各種考試題,題庫,初中,高中,大學(xué)四六

運動步數(shù)有氧達人2018-06-03

記錄運動步數(shù),積累氧氣值。還可偷

每日養(yǎng)生app2018-06-03

每日養(yǎng)生,天天健康

體育訓(xùn)練成績評定2018-06-03

通用課目體育訓(xùn)練成績評定