Linux内核工作队列探秘

简介: 工作队列的节能特性最早由3.11内核引入,此后,50多个子系统和设备驱动开始使用它。而节能工作队列则被广泛用于手持设备(如平板电脑,智能手机)。ARM平台上,在Android系统中使用节能工作队列,可以显著降低能源消耗。

工作队列的节能特性最早由3.11内核引入,此后,50多个子系统和设备驱动开始使用它。而节能工作队列则被广泛用于手持设备(如平板电脑,智能手机)。ARM平台上,在Android系统中使用节能工作队列,可以显著降低能源消耗。


在Linux kernel中,工作队列是常见的延后执行机制,经常出现在异步执行上下文中。上下文由内核工作线程提供,当有任务被放入队列(入队操作)时,工作线程将会被唤醒。内核实现时,工作队列由strut workqueue_struct表示,而任务由strut work_struct表示。work_struct中包含一个回调函数,该函数将会被工作线程调用,以表示任务被执行。一旦工作队列上的所有任务执行完毕,工作线程又继续睡眠。


下面是工作队列相关的常见API:

bool queue_work(...); bool queue_work_on(...); bool queue_delayed_work(...); bool queue_delayed_work_on(...);


queue_work_on()和queue_delayed_work_on()指定了任务由哪个cpu上的工作线程执行,另两个函数允许任务运行在任意cpu上。对于前两个函数,任务将会被立即执行;而对于后两个函数,任务需要等待一段时间才会被执行。


绑定工作队列的缺陷

在内核中,一种常见的使用工作队列的场景是处理周期性的工作:不断重复执行队列任务,并由回调函数重新将任务放入队列。下面是一段演示程序:

static void foohandler(struct work_struct *work)
{
    struct delayed_work *dwork = to_delayed_work(work);
    /* Do some work here */
    queue_delayed_work(system_wq,dwork,10);
}
voidfoo_init(void)
{
    struct delayed_work *dwork = kmalloc(sizeof(*dwork), GFP_KERNEL);
    INIT_DEFERRABLE_WORK(dwork,foo_handler);
    queue_delayed_work(system_wq,dwork,10);
}


读者可能会认为,任务将会被任意cpu执行(由调度器选出一个最合适的cpu)。遗憾的是,这不完全正确。工作队列机制倾向于将任务放入local cpu(即,执行queue_delayed_work()的那个cpu),除非local cpu被wq_unbound_cpumask屏蔽了。举个例子,在8核平台上,上面演示程序中的回调函数总是在一个cpu上执行,尽管该cpu处于idle状态且存在其它cpu处于运行状态。


wq_unbound_cpumask表示可以执行“工作队列任务”的cpu集合,注意,只有当该任务没有通过API(xxx_work_on())指定到某个特定的cpu时,该掩码才生效。该掩码可以通过 /sys/devices/virtual/workqueue/cpumask设置。


从节能的角度看,一个正在执行正常程序的cpu被中断,然后执行工作队列任务,这是可接受的。反之,如果唤醒一个处于idle状态的cpu,然后仅仅更新时钟和将任务放入队列,这将消耗更多能源。cpu绑定有时并不能带来好的性能,因为被绑定的cpu并不一定是调度器认为的负载最轻的cpu,此时调度器不能进行负载均衡。


工作队列的节能特性

默认情况下,工作队列的节能特性是关闭的。使能该特性有两种方式:

  1. 内核启动参数 workqueue.power_efficient=true
  2. 编译内核时打开开关 CONFIGWQPOWER_EFFICIENT = y


一旦使能节能模式,我们就可以在调用 alloc_workqueue() 时传入WQ_POWER_EFFICIENT标志,建立节能工作队列。内核中还维护了两个全局的节能工作队列:system_power_efficient_wq 和 system_freezable_power_efficient_wq,当用户不想建立自己私有的队列时,可以使用它们。


不同于之前的local cpu策略,节能模式下,任务入队时,总是由调度器提供一个target cpu,然后将任务放入target cpu上的工作队列。因此,现在任务可以在不同的cpu执行了。


不幸的是,这并不意味着调度器总是选择一个最优的cpu去执行工作队列任务。调度器的调度算法非常复杂,但总体上,它在考虑cache亲和性的基础上,倾向于选择一个负载最轻的cpu。如果,工作队列任务没有被快速执行完,任务还有可能会被调度器迁移到别的cpu上。


节能特性的实现依赖于cpu调度器,但cpu调度器更主要的设计点是性能,其次才在调度策略中加入了能效方面的考虑。因此,当前实现的节能工作队列显然没有采用最优的节能策略,但它在能效方面确实表现得更好了。


很自然的,我们会想到,是否所有的工作队列都应该工作在节能模式下呢?节能工作队列有一个明显的缺点:每次执行任务都在不同的cpu上,cache亲和性被破坏,可能会导致大量cache miss(取决于任务的访存特性),这会显著降低性能。但有的时候,队列任务对cache miss不敏感,调度器的负载均衡操作反而能显著降低队列任务的响应延迟。考虑到上述两方面,在使用节能队列时需要仔认真地评估。


测试数据

在32-bit ARM big.LITTLE平台上运行benchmark,该平台具有4个Cortex A7核和4个Cortex A15核。除了用aplay在后台播放音乐外,整个系统没有其它负载。测试内核采用Linaro公司的ubuntu-devel版本,此外还打了一些调度器补丁。测试结果显示,节能工作队列的能源效率平均提高15.7%。具体数据如下:

                 Vanilla kernel +        Vanilla   Kernel+
                                                 scheduler patches +
                 scheduler patches       power-efficient wq
A15 cluster      0.322866            0.2289042
A7 cluster       2.619137            2.2514632
Total               2.942003            2.4803674

如果使用upstream kernel,节能工作队列将会工作得更好。因为在后续调度其中,越来却多的考虑了能源效率。

—— 完 ——


加入龙蜥社群

加入微信群:添加社区助理-龙蜥社区小龙(微信:openanolis_assis),备注【龙蜥】拉你入群;加入钉钉群:扫描下方钉钉群二维码。欢迎开发者/用户加入龙蜥OpenAnolis社区交流,共同推进龙蜥社区的发展,一起打造一个活跃的、健康的开源操作系统生态!

 1.jpeg               龙蜥助手.jpeg

                    龙蜥社区钉钉交流群                            龙蜥社区-小龙


关于龙蜥社区

龙蜥社区是由企事业单位、高等院校、科研单位、非营利性组织、个人等按照自愿、平等、开源、协作的基础上组成的非盈利性开源社区。龙蜥社区成立于2020年9月,旨在构建一个开源、中立、开放的Linux上游发行版社区及创新平台。

短期目标是开发Anolis OS作为CentOS替代版,重新构建一个兼容国际Linux主流厂商发行版。中长期目标是探索打造一个面向未来的操作系统,建立统一的开源操作系统生态,孵化创新开源项目,繁荣开源生态。

龙蜥OS 8.4已发布,支持x86_64和ARM64架构,完善适配Intel、飞腾、海光、兆芯、鲲鹏芯片。

欢迎下载:https://openanolis.cn/download

加入我们,一起打造面向未来的开源操作系统!

Https://openanolis.cn

相关文章
|
10天前
|
算法 Linux 调度
深入理解Linux内核调度器:从基础到优化####
本文旨在通过剖析Linux操作系统的心脏——内核调度器,为读者揭开其高效管理CPU资源的神秘面纱。不同于传统的摘要概述,本文将直接以一段精简代码片段作为引子,展示一个简化版的任务调度逻辑,随后逐步深入,详细探讨Linux内核调度器的工作原理、关键数据结构、调度算法演变以及性能调优策略,旨在为开发者与系统管理员提供一份实用的技术指南。 ####
45 4
|
14天前
|
缓存 算法 Linux
深入理解Linux内核调度器:公平性与性能的平衡####
真知灼见 本文将带你深入了解Linux操作系统的核心组件之一——完全公平调度器(CFS),通过剖析其设计原理、工作机制以及在实际系统中的应用效果,揭示它是如何在众多进程间实现资源分配的公平性与高效性的。不同于传统的摘要概述,本文旨在通过直观且富有洞察力的视角,让读者仿佛亲身体验到CFS在复杂系统环境中游刃有余地进行任务调度的过程。 ####
36 6
|
5天前
|
算法 Linux 开发者
Linux内核中的锁机制:保障并发控制的艺术####
本文深入探讨了Linux操作系统内核中实现的多种锁机制,包括自旋锁、互斥锁、读写锁等,旨在揭示这些同步原语如何高效地解决资源竞争问题,保证系统的稳定性和性能。通过分析不同锁机制的工作原理及应用场景,本文为开发者提供了在高并发环境下进行有效并发控制的实用指南。 ####
|
13天前
|
缓存 资源调度 安全
深入探索Linux操作系统的心脏——内核配置与优化####
本文作为一篇技术性深度解析文章,旨在引领读者踏上一场揭秘Linux内核配置与优化的奇妙之旅。不同于传统的摘要概述,本文将以实战为导向,直接跳入核心内容,探讨如何通过精细调整内核参数来提升系统性能、增强安全性及实现资源高效利用。从基础概念到高级技巧,逐步揭示那些隐藏在命令行背后的强大功能,为系统管理员和高级用户打开一扇通往极致性能与定制化体验的大门。 --- ###
41 9
|
12天前
|
缓存 负载均衡 Linux
深入理解Linux内核调度器
本文探讨了Linux操作系统核心组件之一——内核调度器的工作原理和设计哲学。不同于常规的技术文章,本摘要旨在提供一种全新的视角来审视Linux内核的调度机制,通过分析其对系统性能的影响以及在多核处理器环境下的表现,揭示调度器如何平衡公平性和效率。文章进一步讨论了完全公平调度器(CFS)的设计细节,包括它如何处理不同优先级的任务、如何进行负载均衡以及它是如何适应现代多核架构的挑战。此外,本文还简要概述了Linux调度器的未来发展方向,包括对实时任务支持的改进和对异构计算环境的适应性。
34 6
|
13天前
|
缓存 Linux 开发者
Linux内核中的并发控制机制:深入理解与应用####
【10月更文挑战第21天】 本文旨在为读者提供一个全面的指南,探讨Linux操作系统中用于实现多线程和进程间同步的关键技术——并发控制机制。通过剖析互斥锁、自旋锁、读写锁等核心概念及其在实际场景中的应用,本文将帮助开发者更好地理解和运用这些工具来构建高效且稳定的应用程序。 ####
32 5
|
13天前
|
算法 Unix Linux
深入理解Linux内核调度器:原理与优化
本文探讨了Linux操作系统的心脏——内核调度器(Scheduler)的工作原理,以及如何通过参数调整和代码优化来提高系统性能。不同于常规摘要仅概述内容,本摘要旨在激发读者对Linux内核调度机制深层次运作的兴趣,并简要介绍文章将覆盖的关键话题,如调度算法、实时性增强及节能策略等。
|
14天前
|
存储 监控 安全
Linux内核调优的艺术:从基础到高级###
本文深入探讨了Linux操作系统的心脏——内核的调优方法。文章首先概述了Linux内核的基本结构与工作原理,随后详细阐述了内核调优的重要性及基本原则。通过具体的参数调整示例(如sysctl、/proc/sys目录中的设置),文章展示了如何根据实际应用场景优化系统性能,包括提升CPU利用率、内存管理效率以及I/O性能等关键方面。最后,介绍了一些高级工具和技术,如perf、eBPF和SystemTap,用于更深层次的性能分析和问题定位。本文旨在为系统管理员和高级用户提供实用的内核调优策略,以最大化Linux系统的效率和稳定性。 ###
|
13天前
|
Java Linux Android开发
深入探索Android系统架构:从Linux内核到应用层
本文将带领读者深入了解Android操作系统的复杂架构,从其基于Linux的内核到丰富多彩的应用层。我们将探讨Android的各个关键组件,包括硬件抽象层(HAL)、运行时环境、以及核心库等,揭示它们如何协同工作以支持广泛的设备和应用。通过本文,您将对Android系统的工作原理有一个全面的认识,理解其如何平衡开放性与安全性,以及如何在多样化的设备上提供一致的用户体验。
|
15天前
|
Linux 数据库
Linux内核中的锁机制:保障并发操作的数据一致性####
【10月更文挑战第29天】 在多线程编程中,确保数据一致性和防止竞争条件是至关重要的。本文将深入探讨Linux操作系统中实现的几种关键锁机制,包括自旋锁、互斥锁和读写锁等。通过分析这些锁的设计原理和使用场景,帮助读者理解如何在实际应用中选择合适的锁机制以优化系统性能和稳定性。 ####
34 6
下一篇
无影云桌面