跳转至

内核参数

配置文件/etc/sysctl.conf和/proc/sys下内核文件的关系

下面介绍一下/proc/sys下内核文件与配置文件sysctl.conf中变量的对应关系:

由于可以修改的内核参数都在/proc/sys目录下,所以sysctl.conf的变量名省略了目录的前面部分(/proc/sys)。

即将/proc/sys中的文件转换成sysctl中的变量依据下面两个简单的规则:

  1. 去掉前面部分/proc/sys
  2. 将文件名中的斜杠变为点

这两条规则可以将/proc/sys中的任一文件名转换成sysctl中的变量名。

例如:

/proc/sys/net/ipv4/ip_forward =》 net.ipv4.ip_forward

/proc/sys/kernel/hostname =》 kernel.hostname

可以使用下面命令查询所有可修改的变量名

sysctl –a

计算相关:

/proc/sys/kernel/threads-max 最大线程数量,可写入的最小值为20。可写入的最大值由常数FUTEX_TID_MASK(0x3fffffff)给出。如果将超出此范围的值写入threads max,则会出现错误EINVAL

/proc/sys/kernel/pid_max 可分配PID的数量,因此,此文件的值还充当系统范围内进程和线程总数的限制。在32位平台上,32768是pid_max的最大值。在64位系统上,pid_max可以设置为最大为2^22的任何值(pid_max_LIMIT,约400万)。

/usr/include/bits/local_lim.h _POSIX_THREAD_THREADS_MAX 单个进程最大线程数量 /proc/sys/vm/max_map_count 单进程最大分配map

/proc/sys/kernel/watchdog_thresh Linux watchdog 的异常等待时间是通过 /proc/sys/kernel/watchdog_thresh 设置的,一般默认为 60 秒。

/proc/sysrq-trigger 这是一个“神奇”的组合键,你可以向它输入指令,内核会对它做出响应

内存相关:

/proc/sys/vm/swappiness swappiness的值的大小对如何使用swap分区是有着很大的联系的。swappiness=0的时候表示最大限度使用物理内存,然后才是 swap空间,swappiness=100的时候表示积极的使用swap分区,并且把内存上的数据及时的搬运到swap空间里面。linux的基本默认设置为60

/proc/sys/vm/vfs_cache_pressure 默认值100,用于控制回收cache频率,值越小则越倾向于保留cache,0 表示从不回收cache容易导致out-of-memory

/proc/sys/vm/min_free_kbytes 该文件表示强制Linux VM最低保留多少空闲内存(Kbytes)。

/proc/sys/vm/drop_caches 默认为0 输入1释放页缓存cache,2释放索引节点和目录项缓存,3释放页缓存及索引节点和目录项缓存

/proc/sys/vm/overcommit_memory 0 0允许利用算法合理的过度分配,1值允许过度分配,2禁止过度分配

/proc/sys/vm/overcommit_ratio 过度分配的比例

IO相关:

/proc/sys/vm/dirty_background_ratio 该文件表示脏数据到达系统整体内存的百分比,此时触发pdflush进程把脏数据写回磁盘。缺省设置:10 当用户调用write时,如果发现系统中的脏数据大于这阈值(或dirty_background_bytes ),会触发pdflush进程去写脏数据,但是用户的write调用会立即返回,无需等待。pdflush刷脏页的标准是让脏页降低到该阈值以下。即使cgroup限制了用户进程的IOPS,也无所谓。

/proc/sys/vm/dirty_background_bytes 控制脏页内存数量,超过dirty_background_bytes时,内核的flush线程开始回写脏页 默认为0

/proc/sys/vm/dirty_expire_centisecs 该文件表示如果脏数据在内存中驻留时间超过该值,pdflush进程在下一次将把这些数据写回磁盘。缺省设置:3000(1/100秒)

/proc/sys/vm/dirty_writeback_centisecs 该文件表示pdflush进程的唤醒间隔,周期性把超过dirty_expire_centisecs时间的脏数据写回磁盘。 缺省设置:500(1/100秒)

/proc/sys/vm/dirty_ratio 该文件表示如果进程产生的脏数据到达系统整体内存的百分比,此时用户进程自行把脏数据写回磁盘。缺省设置:40。当用户调用write时,如果发现系统中的脏数据大于这阈值(或dirty_bytes ),需要自己把脏数据刷回磁盘,降低到这个阈值以下才返回。注意,此时如果cgroup限制了用户进程的IOPS,那就悲剧了。

/proc/sys/vm/dirty_bytes 控制脏页内存数量,达到dirty_bytes时,执行磁盘写操作的进程开始回写脏页

/proc/sys/vm/nr_pdflush_threads 系统里通常只能有2~8个pdflush进程,当前pdflush进程个数可以通过/proc/sys/vm/nr_pdflush_threads 查看。当系统内全部pdflush进程繁忙超过1秒后,系统会启动一新pdflush进程。当超过一秒后,系统当前全部pdflush进程空闲时,系统会杀死一个pdflush进程。

网络相关:

/proc/sys/net/core/rmem_default 默认的TCP数据接收窗口大小(字节)。229376

/proc/sys/net/core/rmem_max 最大的TCP数据接收窗口(字节)。131071

/proc/sys/net/core/wmem_default 默认的TCP数据发送窗口大小(字节)。229376

/proc/sys/net/core/wmem_max 最大的TCP数据发送窗口(字节)。131071

/proc/sys/net/core/netdev_max_backlog 在每个网络接口接收数据包的速率比内核处理这些包的速率快时,允许送到队列的数据包的最大数目。1000 /proc/sys/net/core/somaxconn 定义了系统中每一个端口最大的监听队列的长度,这是个全局的参数。128

/proc/sys/net/core/optmem_max 表示每个套接字所允许的最大缓冲区的大小。20480 /proc/sys/net/ipv4/tcp_mem 确定TCP栈应该如何反映内存使用,每个值的单位都是内存页(通常是4KB)。第一个值是内存使用的下限;第二个值是内存压力模式开始对缓冲区使用应用压力 的上限;第三个值是内存使用的上限。在这个层次上可以将报文丢弃,从而减少对内存的使用。对于较大的BDP可以增大这些值(注意,其单位是内存页而不是字 节)。94011 125351 188022

/proc/sys/net/ipv4/tcp_rmem 为 自动调优定义socket使用的内存。第一个值是为socket接收缓冲区分配的最少字节数;第二个值是默认值(该值会被rmem_default覆 盖),缓冲区在系统负载不重的情况下可以增长到这个值;第三个值是接收缓冲区空间的最大字节数(该值会被rmem_max覆盖)。4096 87380 4011232

/proc/sys/net/ipv4/tcp_wmem 为自动调优定义socket使用的内存。第一个值是为socket发送缓冲区分配的最少字节数;第二个值是默认值(该值会被wmem_default覆 盖),缓冲区在系统负载不重的情况下可以增长到这个值;第三个值是发送缓冲区空间的最大字节数(该值会被wmem_max覆盖)。4096 16384 4011232

/proc/sys/net/ipv4/tcp_keepalive_time TCP发送keepalive探测消息的间隔时间(秒),用于确认TCP连接是否有效。 7200 默认为2小时,可以改成20分钟

/proc/sys/net/ipv4/tcp_keepalive_intvl 探测消息未获得响应时,重发该消息的间隔时间(秒)。75

/proc/sys/net/ipv4/tcp_keepalive_probes 在认定TCP连接失效之前,最多发送多少个keepalive探测消息。9

/proc/sys/net/ipv4/tcp_sack 启用有选择的应答(1表示启用),通过有选择地应答乱序接收到的报文来提高性能,让发送者只发送丢失的报文段,(对于广域网通信来说)这个选项应该启用,但是会增加对CPU的占用。1

/proc/sys/net/ipv4/tcp_fack 启用转发应答,可以进行有选择应答(SACK)从而减少拥塞情况的发生,这个选项也应该启用。1

/proc/sys/net/ipv4/tcp_timestamps TCP时间戳(会在TCP包头增加12个字节),以一种比重发超时更精确的方法(参考RFC 1323)来启用对RTT 的计算,为实现更好的性能应该启用这个选项。1

/proc/sys/net/ipv4/tcp_window_scaling 启用RFC 1323定义的window scaling,要支持超过64KB的TCP窗口,必须启用该值(1表示启用),TCP窗口最大至1GB,TCP连接双方都启用时才生效。1

/proc/sys/net/ipv4/tcp_syncookies 表示是否打开TCP同步标签(syncookie),内核必须打开了CONFIG_SYN_COOKIES项进行编译,同步标签可以防止一个套接字在有过多试图连接到达时引起过载。1 表示开启SYN Cookies。当出现SYN等待队列溢出时,启用cookies来处理,可防范少量SYN攻击,默认为0,表示关闭

/proc/sys/net/ipv4/tcp_tw_reuse 表示是否允许将处于TIME-WAIT状态的socket(TIME-WAIT的端口)用于新的TCP连接 。默认为0,建议打开,设置为1 /proc/sys/net/ipv4/tcp_tw_recycle 能够更快地回收TIME-WAIT套接字。表示开启TCP连接中TIME-WAIT sockets的快速回收,默认为0,表示关闭。

/proc/sys/net/ipv4/tcp_fin_timeout 对于本端断开的socket连接,TCP保持在FIN-WAIT-2状态的时间(秒)。对方可能会断开连接或一直不结束连接或不可预料的进程死亡。默认值为60,建议为30 /proc/sys/net/ipv4/ip_local_port_range 表示TCP/UDP协议允许使用的本地端口号 默认为 32768 61000 建议修改为 1024 65000 | /proc/sys/net/ipv4/tcp_max_syn_backlog 对于还未获得对方确认的连接请求,可保存在队列中的最大数目。如果服务器经常出现过载,可以尝试增加这个数字。 表示SYN队列的长度,默认为1024,加大队列长度为8192,可以容纳更多等待连接的网络连接数。

/proc/sys/net/ipv4/tcp_low_latency 允许TCP/IP栈适应在高吞吐量情况下低延时的情况,这个选项应该禁用。0

/proc/sys/net/ipv4/tcp_westwood 启用发送者端的拥塞控制算法,它可以维护对吞吐量的评估,并试图对带宽的整体利用情况进行优化,对于WAN 通信来说应该启用这个选项。0

/proc/sys/net/ipv4/tcp_bic 为快速长距离网络启用Binary Increase Congestion,这样可以更好地利用以GB速度进行操作的链接,对于WAN通信应该启用这个选项。1

/proc/sys/net/ipv4/tcp_max_tw_buckets 表示系统同时保持TIME_WAIT套接字的最大数量,如果超过这个数字,TIME_WAIT套接字将立刻被清除并打印警告信息。默认为180000,改为5000。对于Apache、Nginx等服务器,上几行的参数可以很好地减少TIME_WAIT套接字数量,但是对于 Squid,效果却不大。此项参数可以控制TIME_WAIT套接字的最大数量,避免Squid服务器被大量的TIME_WAIT套接字拖死。