news 2026/8/22 6:44:33

ARM 架构中的数据内存屏障指令 DMB

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ARM 架构中的数据内存屏障指令 DMB

ARM 架构中的数据内存屏障指令 DMB

本文来自于我关于 ARM架构中内存屏障和同步指令的系列文章。欢迎阅读、点评与交流~

1、ARM 架构中的数据内存屏障指令 DMB
2、ARM 架构中的数据同步屏障指令 DSB
3、ARM 架构中的指令同步屏障 ISB

核心定义

数据内存屏障指令 DMB是一种同步指令,用于保证在它之前的所有内存访问(读/写)操作,在它之后的所有内存访问操作开始之前,已经完成

简单来说,它是一个“栅栏”或“路障”,告诉处理器:“把我前面所有关于内存的操作都搞定,再处理后面的。”


为什么需要 DMB?

主要原因在于现代处理器(包括ARM)的乱序执行多级缓存架构。

  1. 乱序执行:为了提高性能,CPU和编译器可能会对没有依赖关系的指令进行重新排序。在单核程序中,这通常没问题,因为最终结果保持一致。但在多核/多线程环境下,这种重排序可能导致其他处理器看到不一致的内存状态。
  2. 缓存:每个CPU核心有自己私有的缓存。一个核心对内存的修改,不会立即被其他核心看到。DMB可以与其他同步机制配合,确保内存操作的全局可见性顺序。

没有DMB会导致的问题示例(典型的生产者-消费者场景):

假设有两个核心,共享两个变量:

  • flag(表示数据是否就绪)
  • data(实际数据)

生产者核心(Core A)执行:

STR R1, [data] // 1. 写入数据 STR #1, [flag] // 2. 设置标志位为1,表示数据就绪

由于乱序执行,Core A的这两条写入指令在全局内存顺序上可能被其他核心看到是颠倒的(即Core B先看到flag=1,后看到新的data)。

消费者核心(Core B)执行:

loop: LDR R2, [flag] // 检查标志位 CMP R2, #0 BEQ loop // 如果为0,循环等待 LDR R3, [data] // 读取数据

如果Core B先看到了flag=1(但此时data的更新还未可见),它就会去读取旧的、未更新的data,导致程序逻辑错误。

解决方法:在生产者核心的两条写入指令之间插入DMB。

STR R1, [data] // 1. 写入数据 DMB // 屏障:保证步骤1的写入在任何后续写入之前完成 STR #1, [flag] // 2. 设置标志位

现在,Core B绝对不会在见到新的flag之前,见不到新的data


DMB 的语法和参数

在ARM汇编中,DMB指令可以带一个选项,用来指定屏障的作用域,以在性能和正确性之间取得平衡。

语法:DMB <option>

常见的选项(基于ARMv7/v8架构):

选项含义作用域
SY全系统屏障影响系统中的所有观察者(所有其他CPU核心、GPU、DMA控制器等)。这是最严格、最常用的选项。
ISH内部可共享域屏障只影响当前CPU集群内(通常指共享L2/L3缓存)的所有核心。
NSH非可共享屏障只影响当前核心的流水线,不保证对其他核心的可见性。用于保证本核心指令的顺序。
OSH外部可共享域屏障影响当前核心所在域之外的可共享观察者(例如,对其他集群或系统组件)。

在Linux内核驱动或底层代码中,最常用的是DMB SY


DMB 与其他屏障指令的关系

ARM架构有一组内存屏障指令:

  1. DMB(数据内存屏障)

    • 关注点:内存访问指令之间的顺序
    • 保证屏障前后的Load(读)和Store(写)指令的相对顺序。
    • 它不保证这些访问何时对他人可见,只保证本核心发出的访问请求的顺序。
  2. DSB(数据同步屏障)

    • 比DMB更严格
    • 它不仅像DMB一样排序访问,还会等待屏障之前的所有内存访问彻底完成(例如,缓存写入、总线事务结束),然后再执行屏障后的任何指令(不仅仅是内存访问)。
    • 常用在更改内存映射(如修改页表)、切换上下文等需要确保之前操作完全生效的场景。
  3. ISB(指令同步屏障)

    • 刷新处理器流水线,确保所有先前指令都执行完毕,然后从缓存或内存中重新预取指令
    • 常用在写入系统控制寄存器(如MMU、缓存配置)之后,确保后续指令使用新的配置执行。

一个简单比喻

  • DMB:像工地上的工头,对工人们喊:“先把所有运砖的活干完,才能开始运沙子的活!”(只排序任务类型)。
  • DSB:工头喊:“所有运砖的活必须全部完工、砖块到位验收,任何人才能开始下一项工作!”(等待完成并排序)。
  • ISB:工头喊:“全体休息5分钟,忘记刚才所有工作安排,然后听我发布新指令!”(清空流水线,重新开始)。

在高级语言中的使用

你通常不会直接写DMB指令。高级语言通过以下方式使用它:

  • C/C++:使用编译器内置函数(如GCC的__asm__ volatile("dmb sy" ::: "memory"))或调用操作系统提供的屏障API。
  • Linux内核:使用mb(),rmb(),wmb()等宏,它们会根据架构展开为相应的DMB/DSB指令。
  • C++11/Java:使用原子操作(std::atomic)或特定的内存序(如std::memory_order_seq_cst,std::memory_order_acquire/release),编译器会在生成的机器码中自动插入必要的内存屏障。

总结

DMB的核心价值在于:它是在一个弱内存序模型的架构(如ARM)上,实现多核并发程序正确性基础硬件原语。它通过在关键位置强制内存操作的顺序,使得程序员和编译器能够推理并控制多线程间的内存可见性,从而构建出可靠的锁、无锁数据结构、同步机制等。

简言之:DMB是让混乱的、为性能而优化过的内存访问世界,恢复到一个程序员可以理解和控制的、有序状态的关键工具。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/22 6:31:44

2026中专毕业想做出纳,考哪些证书企业比较认可?这些证让你轻松入职!

2026年&#xff0c;出纳岗位的竞争早已不再是“谁会用网银、谁会开发票”就能胜出的时代。随着企业财务数字化转型加速&#xff0c;越来越多公司要求出纳不仅具备基础的收付款和票据处理能力&#xff0c;还需掌握银行对账自动化、税务申报辅助、资金流水分析等复合技能。对于中…

作者头像 李华
网站建设 2026/8/22 4:00:28

TileLang终极指南:45分钟内打造你的首个高性能GPU算子

TileLang终极指南&#xff1a;45分钟内打造你的首个高性能GPU算子 【免费下载链接】tilelang Domain-specific language designed to streamline the development of high-performance GPU/CPU/Accelerators kernels 项目地址: https://gitcode.com/GitHub_Trending/ti/tile…

作者头像 李华
网站建设 2026/8/21 22:15:23

HFI方波高频注入与ESMO增强滑膜代码开发文档

高频注入代码 增强滑膜esmo代码 HFI方波高频注入&#xff0c;提 高频注入代码 增强滑膜esmo代码 HFI方波高频注入&#xff0c;提供HFI和esmo详细开发文档。高频注入这玩意儿在无感电机控制里算是老熟人了&#xff0c;尤其是方波注入方案&#xff0c;实测抗噪声能力比正弦波方案…

作者头像 李华
网站建设 2026/8/22 17:12:04

Pandas实用文档

Pandas 是一个基于 Python 的数据处理与分析库&#xff0c;主要用于处理结构化数据&#xff0c;例如 Excel 表格、CSV 文件、JSON数据等。 该库提供了高效且易于使用的数据结构&#xff0c;如 DataFrame 和 Series&#xff0c;能够支持数据的读取、清洗、整理、统计与存储等操…

作者头像 李华
网站建设 2026/8/22 8:11:41

基于Java的安全生产监察执法智慧管理系统的设计与实现全方位解析:附毕设论文+源代码

1. 为什么这个毕设项目值得你 pick ?安全生产监察执法智慧管理系统集成了多种功能模块&#xff0c;如企业管理、培训管理、检查管理等。系统创新性地将各类信息数字化处理和实时监控纳入统一平台&#xff0c;不仅提升了工作效率与数据准确性&#xff0c;还增强了监管力度及应急…

作者头像 李华
网站建设 2026/8/21 15:21:01

构建一个LangChain RAG应用

构建一个LangChain RAG应用01. 外挂知识库的聊天机器人架构在 RAG 应用中&#xff0c;会通过外部的检索器/知识库检索人类的提问&#xff0c;然后将检索到的信息填充到提示模板中&#xff0c;一起传递给大语言模型&#xff0c;让其生成特定的内容&#xff0c;无论 RAG 应用有多…

作者头像 李华