互联网服务Linux

大家在linux系统运维时排查问题时,一般的分析思路有哪些呢?

大家在排查问题时一般的分析思路有哪些呢?讲解案例前可以先聊聊常见的分析思路和小技巧!显示全部

大家在排查问题时一般的分析思路有哪些呢?讲解案例前可以先聊聊常见的分析思路和小技巧!

收起
参与33

查看其它 3 个回答zhanxuechao的回答

zhanxuechaozhanxuechao咨询专家数字研究院

1.整体情况

  • top/htop/atop 命令查看进程/线程、CPU、内存使用情况,CPU使用情 况;
  • dstat 2 查看CPU、磁盘IO、网络IO、换页、中断、切换,系统I/O状态;
  • vmstat 2 查看内存使用情况,内存状态;
  • iostat -d -x 2 查看所有磁盘的IO情况,系统I/O状态;
  • iotop 查看IO靠前的进程,系统的I/O状态;
  • perf top 查看占用CPU最多的函数,CPU使用情况;
  • perf record -ag -- sleep 15 perf report 查看CPU事件占比,调用 栈,CPU使用情况;
  • sar -n DEV 2 查看网卡的吞吐,网卡状态;
  • /usr/share/bcc/tools/filetop -C 查看每个文件的读写情况,系统 的I/O状态; /usr/share/bcc/tools/opensnoop 显示正在被打开的文件,系统的I/O状 态;
  • mpstat -P ALL 1 单核CPU是否被打爆;
  • ps aux --sort=-%cpu 按CPU使用率排序,找出CPU消耗最多进程;
  • ps -eo pid,comm,rss | awk '{m=$3/1e6;s["*"]+=m;s[$2]+=m} END{for (n in s) printf"%10.3f GB %s\n",s[n],n}' | sort -nr | head -20 统 计前20内存占用;
  • awk 'NF>3{s[""]+=s[$1]=$3$4/1e6} END{for (n in s) printf"%10.1f MB %s\n",s[n],n}' /proc/slabinfo | sort -nr | head -20 统计内核 前20slab的占用;

2.进程分析,进程占用的资源

  • pidstat 2 -p 进程号,查看可疑进程CPU使用率变化情况;
  • pidstat -w -p 进程号 ,查看可疑进程的上下文切换情况;
  • pidstat -d -p 进程号 ,查看可疑进程的IO情况;
  • lsof -p 进程号,查看进程打开的文件;
  • strace -f -T -tt -p 进程号,显示进程发起的系统调用;

3.协议栈分析,连接/协议栈状态

  • ethtool -S 查看网卡硬件情况;
  • cat /proc/net/softnet_stat/ifconfig eth1 查看网卡驱动情况;
  • netstat -nat|awk '{print awk $NF}'|sort|uniq -c|sort -n 查看连接 状态分布;
  • ss -ntp 或者 netstat -ntp 查看连接队列;
  • netstat -s 查看协议栈情况;

4.方法论

  • RED方法:监控服务的请求数(Rate)、错误数(Errors)、响应时间(Duration)。Weave Cloud在监 控微服务性能时提出的思路。
  • USE方法:监控系统资源的使用率(Utilization)、饱和度(Saturation)、错误数(Errors)

附件:

附件图标Linux性能问题分析流程与性能优化思路.pdf (2.8 MB)

IT咨询服务 · 2023-02-24
浏览1223

回答者

zhanxuechao
咨询专家数字研究院
擅长领域: 云计算数据库安全

zhanxuechao 最近回答过的问题

回答状态

  • 发布时间:2023-02-24
  • 关注会员:6 人
  • 回答浏览:1223
  • X社区推广