我的编程空间,编程开发者的网络收藏夹
学习永远不晚

Linux 网络延迟排查方法详解

短信预约 -IT技能 免费直播动态提醒
省份

北京

  • 北京
  • 上海
  • 天津
  • 重庆
  • 河北
  • 山东
  • 辽宁
  • 黑龙江
  • 吉林
  • 甘肃
  • 青海
  • 河南
  • 江苏
  • 湖北
  • 湖南
  • 江西
  • 浙江
  • 广东
  • 云南
  • 福建
  • 海南
  • 山西
  • 四川
  • 陕西
  • 贵州
  • 安徽
  • 广西
  • 内蒙
  • 西藏
  • 新疆
  • 宁夏
  • 兵团
手机号立即预约

请填写图片验证码后获取短信验证码

看不清楚,换张图片

免费获取短信验证码

Linux 网络延迟排查方法详解

e0eac0bf7c3f43238f387bf002e3e639.png


 概要

 

在 Linux 服务器中,可以通过内核调优、DPDK 以及 XDP 等多种方式提高服务器的抗攻击能力,降低 DDoS 对正常服务的影响。在应用程序中,可以使用各级缓存、WAF、CDN 等来缓解 DDoS 对应用程序的影响。

但是需要注意的是,如果 DDoS 流量已经到达 Linux 服务器,那么即使应用层做了各种优化,网络服务延迟一般也会比平时大很多。

因此,在实际应用中,我们通常使用 Linux 服务器,配合专业的流量清洗和网络防火墙设备,来缓解这个问题。

除了 DDoS 导致的网络延迟增加,我想你一定见过很多其他原因导致的网络延迟,例如:

  • 网络传输慢导致的延迟。

  • Linux 内核协议栈数据包处理速度慢导致的延迟。

  • 应用程序数据处理速度慢造成的延迟等。

那么当我们遇到这些原因造成的延误时,我们该怎么办呢?如何定位网络延迟的根本原因?让我们在本文中讨论网络延迟。

Linux 网络延迟

谈到网络延迟(Network Latency),人们通常认为它是指网络数据传输所需的时间。但是,这里的“时间”是指双向流量,即数据从源发送到目的地,然后从目的地地址返回响应的往返时间:RTT(Round-Trip Time)。

除了网络延迟之外,另一个常用的指标是应用延迟(Application Latency),它是指应用接收请求并返回响应所需的时间。通常,应用延迟也称为往返延迟,它是网络数据传输时间加上数据处理时间的总和。

通常人们使用ping命令来测试网络延迟,ping是基于 ICMP 协议的,它通过计算 ICMP 发出的响应报文和 ICMP 发出的请求报文之间的时间差来获得往返延迟时间。这个过程不需要特殊的认证,从而经常被很多网络攻击所利用,如,端口扫描工具nmap、分组工具hping3等。

因此,为了避免这些问题,很多网络服务都会禁用 ICMP,这使得我们无法使用 ping 来测试网络服务的可用性和往返延迟。在这种情况下,您可以使用traceroute或hping3的 TCP 和 UDP 模式来获取网络延迟。

例如:

# -c: 3 requests# -S: Set TCP SYN# -p: Set port to 80$ hping3 -c 3 -S -p 80 google.comHPING google.com (eth0 142.250.64.110): S set, 40 headers + 0 data byteslen=46 ip=142.250.64.110 ttl=51 id=47908 sport=80 flags=SA seq=0 win=8192 rtt=9.3 mslen=46 ip=142.250.64.110 ttl=51 id=6788  sport=80 flags=SA seq=1 win=8192 rtt=10.9 mslen=46 ip=142.250.64.110 ttl=51 id=37699 sport=80 flags=SA seq=2 win=8192 rtt=11.9 ms--- baidu.com hping statistic ---3 packets transmitted, 3 packets received, 0% packet lossround-trip min/avg/max = 9.3/10.9/11.9 ms

当然,你也可以使用traceroute:

$ traceroute --tcp -p 80 -n google.comtraceroute to google.com (142.250.190.110), 30 hops max, 60 byte packets 1  * * * 2  240.1.236.34  0.198 ms * * 3  * * 243.254.11.5  0.189 ms 4  * 240.1.236.17  0.216 ms 240.1.236.24  0.175 ms 5  241.0.12.76  0.181 ms 108.166.244.15  0.234 ms 241.0.12.76  0.219 ms ...24  142.250.190.110  17.465 ms 108.170.244.1  18.532 ms 142.251.60.207  18.595 ms

traceroute会在路由的每一跳(hop)发送三个数据包,并在收到响应后输出往返延迟。如果没有响应或响应超时(默认 5s),将输出一个星号*。

案例展示

我们需要在此演示中托管 host1 和 host2 两个主机:

  • host1 (192.168.0.30):托管两个 Nginx Web 应用程序(正常和延迟)

  • host2 (192.168.0.2):分析主机

host1 准备

在 host1 上,让我们运行启动两个容器,它们分别是官方 Nginx 和具有延迟版本的 Nginx:

# Official nginx$ docker run --network=host --name=good -itd nginxfb4ed7cb9177d10e270f8320a7fb64717eac3451114c9fab3c50e02be2e88ba2# Latency version of nginx$ docker run --name nginx --network=host -itd feisky/nginx:latencyb99bd136dcfd907747d9c803fdc0255e578bad6d66f4e9c32b826d75b6812724

运行以下命令以验证两个容器都在为流量提供服务:

$ curl http://127.0.0.1...

Thank you for using nginx.

$ curl http://127.0.0.1:8080...

Thank you for using nginx.

host2 准备

现在让我们用上面提到的hping3来测试它们的延迟,看看有什么区别。在 host2 中,执行以下命令分别测试案例机的 8080 端口和 80 端口的延迟:

80 端口:

$ hping3 -c 3 -S -p 80 192.168.0.30HPING 192.168.0.30 (eth0 192.168.0.30): S set, 40 headers + 0 data byteslen=44 ip=192.168.0.30 ttl=64 DF id=0 sport=80 flags=SA seq=0 win=29200 rtt=7.8 mslen=44 ip=192.168.0.30 ttl=64 DF id=0 sport=80 flags=SA seq=1 win=29200 rtt=7.7 mslen=44 ip=192.168.0.30 ttl=64 DF id=0 sport=80 flags=SA seq=2 win=29200 rtt=7.6 ms--- 192.168.0.30 hping statistic ---3 packets transmitted, 3 packets received, 0% packet lossround-trip min/avg/max = 7.6/7.7/7.8 ms

8080 端口:

# 测试8080端口延迟$ hping3 -c 3 -S -p 8080 192.168.0.30HPING 192.168.0.30 (eth0 192.168.0.30): S set, 40 headers + 0 data byteslen=44 ip=192.168.0.30 ttl=64 DF id=0 sport=8080 flags=SA seq=0 win=29200 rtt=7.7 mslen=44 ip=192.168.0.30 ttl=64 DF id=0 sport=8080 flags=SA seq=1 win=29200 rtt=7.6 mslen=44 ip=192.168.0.30 ttl=64 DF id=0 sport=8080 flags=SA seq=2 win=29200 rtt=7.3 ms--- 192.168.0.30 hping statistic ---3 packets transmitted, 3 packets received, 0% packet lossround-trip min/avg/max = 7.3/7.6/7.7 ms

从这个输出中您可以看到两个端口的延迟大致相同,均为 7 毫秒。但这仅适用于单个请求。如果换成并发请求怎么办?接下来,让我们用wrk (https://github.com/wg/wrk) 试试。

80 端口:

$ wrk --latency -c 100 -t 2 --timeout 2 http://192.168.0.30/Running 10s test @ http://192.168.0.30/  2 threads and 100 connections  Thread Stats   Avg      Stdev     Max   +/- Stdev    Latency     9.19ms   12.32ms 319.61ms   97.80%    Req/Sec     6.20k   426.80     8.25k    85.50%  Latency Distribution     50%    7.78ms     75%    8.22ms     90%    9.14ms     99%   50.53ms  123558 requests in 10.01s, 100.15MB readRequests/sec:  12340.91Transfer/sec:     10.00MB

8080 端口:

$ wrk --latency -c 100 -t 2 --timeout 2 http://192.168.0.30:8080/Running 10s test @ http://192.168.0.30:8080/  2 threads and 100 connections  Thread Stats   Avg      Stdev     Max   +/- Stdev    Latency    43.60ms    6.41ms  56.58ms   97.06%    Req/Sec     1.15k   120.29     1.92k    88.50%  Latency Distribution     50%   44.02ms     75%   44.33ms     90%   47.62ms     99%   48.88ms  22853 requests in 10.01s, 18.55MB readRequests/sec:   2283.31Transfer/sec:      1.85MB

从以上两个输出可以看出,官方 Nginx(监听 80 端口)的平均延迟为 9.19ms,而案例 Nginx(监听 8080 端口)的平均延迟为 43.6ms。从延迟分布上来看,官方 Nginx 可以在 9ms 内完成 90% 的请求;对于案例 Nginx,50% 的请求已经达到 44ms。

那么这里发生了什么呢?我们来做一些分析:

在 host1 中,让我们使用tcpdump捕获一些网络数据包:

$ tcpdump -nn tcp port 8080 -w nginx.pcap

现在,在 host2 上重新运行wrk命令

$ wrk --latency -c 100 -t 2 --timeout 2 http://192.168.0.30:8080/

当wrk命令完成后,再次切换回 Terminal 1(host1 的终端)并按 Ctrl+C 结束tcpdump命令。然后,用Wireshark把抓到的nginx.pcap复制到本机(如果 VM1(host1 的虚拟机)已经有图形界面,可以跳过复制步骤),用Wireshark打开。

由于网络包的数量很多,我们可以先过滤一下。例如,选中一个包后,可以右键选择 “Follow”->“TCP Stream”,如下图:

af595940e039426288332a0fc6f871bc.jpeg

 然后,关闭弹出的对话框并返回Wireshark主窗口。这时你会发现Wireshark已经自动为你设置了一个过滤表达式tcp.stream eq 24。如下图所示(图中省略了源 IP 和目的 IP):

731b34ec58c04dddb2f6b86bd7690e90.jpeg

 从这里,您可以看到从三次握手开始,此 TCP 连接的每个请求和响应。当然,这可能不够直观,可以继续点击菜单栏中的 Statistics -> Flow Graph,选择 “Limit to display filter”,将 Flow type 设置为 “TCP Flows”:

b854c76ad5034e0390e51ffeb243ab2f.jpeg

 请注意,此图的左侧是客户端,而右侧是 Nginx 服务器。从这个图中可以看出,前三次握手和第一次 HTTP 请求和响应都相当快,但是第二次 HTTP 请求就比较慢了,尤其是客户端收到服务器的第一个数据包后,该 ACK 响应(图中的蓝线)在 40ms 后才被发送。

看到 40ms 的值,你有没有想到什么?事实上,这是 TCP 延迟 ACK 的最小超时。这是 TCP ACK 的一种优化机制,即不是每次请求都发送一个 ACK,而是等待一段时间(比如 40ms),看看有没有“搭车”的数据包。如果在此期间还有其他数据包需要发送,它们将与 ACK 一起被发送。当然,如果等不及其他数据包,超时后会单独发送 ACK。

由于案例中的客户端发生了 40ms 延迟,我们有理由怀疑客户端开启了延迟确认机制(Delayed Acknowledgment Mechanism)。这里的客户端其实就是之前运行的 wrk。

根据 TCP 文档,只有在 TCP 套接字专门设置了 TCP_QUICKACK 时才会启用快速确认模式(Fast Acknowledgment Mode);否则,默认使用延迟确认机制:

TCP_QUICKACK (since Linux 2.4.4)              Enable  quickack mode if set or disable quickack mode if cleared.  In quickack mode, acks are sent imme‐              diately, rather than delayed if needed in accordance to normal TCP operation.  This flag is  not  perma‐              nent,  it only enables a switch to or from quickack mode.  Subsequent operation of the TCP protocol will              once again enter/leave quickack mode depending on internal  protocol  processing  and  factors  such  as              delayed ack timeouts occurring and data transfer.  This option should not be used in code intended to be              portable.

让我们测试一下我们的质疑:

$ strace -f wrk --latency -c 100 -t 2 --timeout 2 http://192.168.0.30:8080/...setsockopt(52, SOL_TCP, TCP_NODELAY, [1], 4) = 0...

可以看到wrk只设置了TCP_NODELAY选项,没有设置TCP_QUICKACK。现在您可以看到为什么延迟 Nginx(案例 Nginx)响应会出现一个延迟。

 

结论

在本文中,展示了如何分析增加的网络延迟。网络延迟是核心网络性能指标。由于网络传输、网络报文处理等多种因素的影响,网络延迟是不可避免的。但过多的网络延迟会直接影响用户体验。

  • 使用hping3和wrk等工具确认单个请求和并发请求的网络延迟是否正常。

  • 使用traceroute,确认路由正确,并查看路由中每个网关跳跃点的延迟。

  • 使用tcpdump和Wireshark确认网络数据包是否正常收发。

  • 使用strace等观察应用程序对网络 socket 的调用是否正常。

 
欢迎点赞收藏转发,感谢🙏

-End-

 

 

来源地址:https://blog.csdn.net/Rocky006/article/details/131609125

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

Linux 网络延迟排查方法详解

下载Word文档到电脑,方便收藏和打印~

下载Word文档

猜你喜欢

Win10网络延迟高该怎么办?Win10网络延迟高的解决方法

坚信许多朋友们都早已应用Win10操作系统的电脑上好长时间了,在长期的应用中都会碰到网络延迟高的状况,那麼碰到这类问题该怎么办呢?下边就和小编一起来看一下有哪些解决方法吧。Win10网络延迟高的解决方法1、最先按住键盘快捷键“win+r”键
2023-07-11

Linux模拟网络丢包与延迟的方法

netem 与 tc:netem 是 linux 2.6 及以上内核版本提供的一个网络模拟功能模块。该功能模块可以用来在性能良好的局域网中,模拟出复杂的互联网传输性能,诸如低带宽、传输延迟、丢包等等情况。使用 Linux 2.6 (或以上)
2022-06-04

C++实现延迟的方法详解

这篇文章主要为大家详细介绍了C++实现延迟的三个方法,文中的示例代码讲解详细,对我们深入了解C++有一定的帮助,感兴趣的小伙伴可以学习一下
2022-12-27

windows7系统中网络延迟问题的多种解决方法

网络延迟的现象不知道在大家的电脑里频不频繁,如果很频繁出现这个问题的话,那就要动手来解决了,那么肯定会有很多用户要问:我要怎样才能解决Win7网络延迟问题啊? QoS是什么呢?jsQoS(Quality of Service)服务质量,是网
2023-05-30

阿里云服务器网络延迟解决方案

阿里云服务器网络延迟是一个常见的问题,可能会导致网站加载速度慢、应用响应时间长等问题。本文将介绍几种常见的解决阿里云服务器网络延迟的方法,包括优化服务器硬件配置、调整服务器软件设置、使用CDN加速等。方法一:优化服务器硬件配置服务器的硬件配置是影响网络延迟的重要因素之一。如果服务器的CPU、内存和硬盘等硬件设备性
阿里云服务器网络延迟解决方案
2024-01-24

阿里云服务器如何延迟一天详解延迟原因及解决方法

在使用阿里云服务器的过程中,可能会遇到一些延迟问题。如果阿里云服务器延迟一天,可能会影响到您的业务运行和数据安全。本文将详细介绍阿里云服务器延迟一天的原因,以及提供一些解决方法。阿里云服务器延迟一天的原因:网络问题:可能是由于网络问题导致的,例如网络线路故障,网络延迟等。服务器负载过高:如果服务器负载过高,可能会
阿里云服务器如何延迟一天详解延迟原因及解决方法
2023-11-07

Java实现异步延迟队列的方法详解

目前系统中有很多需要用到延时处理的功能,本文就为大家介绍了Java实现异步延迟队列的方法,文中的示例代码讲解详细,需要的可以参考一下
2023-03-22

阿里云服务器低延迟网络异常原因与解决方案

随着互联网的发展,越来越多的企业开始将业务迁移到云服务器上,以提高业务的灵活性和效率。然而,阿里云服务器低延迟网络异常成为了许多用户面临的问题。这篇文章将探讨阿里云服务器低延迟网络异常的原因,并提供相应的解决方案。阿里云服务器低延迟网络异常的原因:网络延迟过高:这是最常见的原因,网络延迟过高会直接影响到服务器的响
阿里云服务器低延迟网络异常原因与解决方案
2023-10-29

linux网络NAT配置方式详解

本文为大家分享了linux网络NAT配置方式,供大家参考,具体内容如下 NAT访问的权限如下: 外网不可以访问虚拟机,主机和虚拟机可以互访,网络和主机也可以互访;1、打开虚拟机——编辑——虚拟网络编辑器——、2、3、进入虚拟机的linux系
2022-06-04

win7系统中网络游戏延迟卡顿或者丢包甚至掉线的解决方法

现在我们使用的电脑宽带上网中,由于在在各式各样的数据在网络介质中通过网络协议(如TCP/IP)进行传输,如果信编程息量过大不加以限制,超额的网络流量就会导致设备反应缓js慢,造成网络延迟,最近就有不少的用户发现网络有点差,玩游戏的时候老是会
2023-06-06

Oracle锁表问题排查方法详解

Oracle锁表问题排查方法详解在使用Oracle数据库时,经常会遇到数据库表被锁住的情况,这会导致其他用户无法访问该表,从而影响系统的正常运行。本文将详细介绍Oracle锁表问题的排查方法,并提供具体的代码示例来帮助解决这一问题。一、
Oracle锁表问题排查方法详解
2024-03-10

android 网络请求库volley方法详解

使用volley进行网络请求:需先将volley包导入androidstudio中 File下的Project Structrue,点加号导包 volley网络请求步骤: 1. 创建请求队列 RequestQue
2022-06-06

Linux/CentOS系统同步网络时间的2种方法详解

由于硬件的原因,机器或多或少的跟标准时间对不上,一个月的误差几秒到几分钟不等。对于服务器来说时间不准,会有很多麻烦。例如,支付的时候,无法下单,游戏无法登录等。 方法一:用 ntpdate从时间服务器更新时间 如果系统没有 ntpdate
2022-06-04

Linux查看网络状态具体方法是什么

这篇文章跟大家分析一下“Linux查看网络状态具体方法是什么”。内容详细易懂,对“Linux查看网络状态具体方法是什么”感兴趣的朋友可以跟着小编的思路慢慢深入来阅读一下,希望阅读后能够对大家有所帮助。下面跟着小编一起深入学习“Linux查看
2023-06-28

网站访问慢的排查方法及解决方案

这篇文章将为大家详细讲解有关网站访问慢的排查方法及解决方案,文章内容质量较高,因此小编分享给大家做个参考,希望大家阅读完这篇文章后对相关知识有一定的了解。当出现网站慢的时候我们脑子中要映出几点原因: 1.程序代码执行方面2.大量数据库操作3
2023-06-12

阿里云服务器实时网络连接查看方法详解

在阿里云服务器上运行应用程序时,了解实时网络连接状态是至关重要的。这可以帮助您确定应用程序是否能够正常运行,以及是否有任何网络问题导致应用程序无法正常工作。本文将详细介绍如何在阿里云服务器上查看实时网络连接。步骤一:登录阿里云服务器首先,您需要登录阿里云服务器,可以通过阿里云的控制台或者使用SSH客户端来实现。步
阿里云服务器实时网络连接查看方法详解
2023-11-09

Linux SysOps SSH登录问题排查与解决方法

在解决Linux SysOps SSH登录问题时,可以采取以下排查和解决方法:1. 确认SSH服务是否正常运行:使用命令`sudo service ssh status`或`systemctl status sshd`来检查SSH服务的运行
2023-10-09

编程热搜

目录