乐于分享
好东西不私藏

optee_os从内核态切换到用户态源码分析

optee_os从内核态切换到用户态源码分析

前言

optee_os用于处理从内核态(EL1S)切换到用户态(EL0S)的代码如下:

/* * We're keeping this code in the same section as the vector to make sure * that it's always available. */eret_to_el0:pauth_el1_to_el0 x1#ifdef CFG_CORE_UNMAP_CORE_AT_EL0/* Point to the vector into the reduced mapping */adr_l x0, thread_user_kcode_offsetldr x0, [x0]mrs x1, vbar_el1sub x1, x1, x0msr vbar_el1, x1isb#ifdef CFG_CORE_WORKAROUND_SPECTRE_BP_SEC/* Store the SP offset in tpidr_el1 to be used below to update SP */adr_l x1, thread_user_kdata_sp_offsetldr x1, [x1]msr tpidr_el1, x1#endif/* Jump into the reduced mapping and continue execution */adr_l x1, 1fsub x1, x1, x0br x11:BTI( bti j)load_xregs sp, THREAD_CORE_LOCAL_X0, 01msr tpidrro_el0, x0/* Update the mapping to exclude the full kernel mapping */mrs x0, ttbr0_el1add_imm x0, __CORE_MMU_BASE_TABLE_OFFSETorr x0, x0, #BIT(TTBR_ASID_SHIFT) /* switch to user mode ASID */msr ttbr0_el1, x0isb#ifdef CFG_CORE_WORKAROUND_SPECTRE_BP_SEC/** Update the SP with thread_user_kdata_sp_offset as described in* init_user_kcode().*/mrs x0, tpidr_el1sub sp, sp, x0#endifmrs x0, tpidrro_el0#elsemrs x0, ttbr0_el1orr x0, x0, #BIT(TTBR_ASID_SHIFT) /* switch to user mode ASID */msr ttbr0_el1, x0isbload_xregs sp, THREAD_CORE_LOCAL_X0, 01#endif/*CFG_CORE_UNMAP_CORE_AT_EL0*/return_from_exception

要理解这段代码,需要先了解其核心的设计背景: 内核页表隔离机制。在 OP-TEE 中由宏 CFG_CORE_UNMAP_CORE_AT_EL0 控制。其目的是为了防御类似 Meltdown(熔断) 的侧信道攻击——当 CPU 处于 EL0(用户态)时,内核的大部分内存映射必须被“解绑”(Unmap),只留下极少量的必要代码(即 Trampoline 蹦床代码)用于处理中断和异常。

内核页表隔离机制

OP-TEE 中,内核(Core)和用户空间(TA)都使用 ttbr0_el1

这与我们在 Linux 内核中看到的常规设计(ttbr0_el1 给用户空间,ttbr1_el1 给内核空间)完全不同

OP-TEE 之所以选择这种设计,是由它的定位、ARM 架构的安全设计(TrustZone)以及历史包袱共同决定的。

为什么 OP-TEE 只用 ttbr0_el1

在 ARM64 架构Linux内核中:

  • ttbr0_el1 通常映射地址空间(如 0x0000_0000_0000_0000 开始)。

  • ttbr1_el1 通常映射地址空间(如 0xFFFF_0000_0000_0000 开始)。

OP-TEE(作为 Secure EL1 的 Microkernel/微内核)在最初设计时,整个内核以及所有的 TA(Trusted Application)都被设计在低地址空间运行

  • 对内核而言:OP-TEE Core 自身驻留在低地址,因此自然而然地使用了 ttbr0_el1

  • 对 TA 而言:当一个用户态的 TA 运行的时候,OP-TEE 采用的是单页表切换机制(单页表上下文切换)。即每次从内核切到 TA,或者从 TA1 切到 TA2,OP-TEE 都会直接修改 ttbr0_el1,让它指向当前 TA 的独立页表。

ttbr1_el1 被用来干嘛

在 OP-TEE 运行的 Secure EL1 环境下,ttbr1_el1 绝大多数情况下是闲置的,或者根本没有配置有效的映射。

/*         * ttbr0_el1 = ttbr0_el1_base + ttbr0_core_offset * core_pos         */        madd        x1, x5, x0, x4        msr        ttbr0_el1, x1        msr        ttbr1_el1, xzr        isb

补充一个特例:在某些支持硬件虚拟化(Secure EL2)或特定大内存映射的特殊高版本 OP-TEE 配置中,ttbr1_el1 偶尔会被用来映射静态的内核高地址段,但主流的、标准标准的 OP-TEE 架构中,依然是 ttbr0_el1 包揽天下。

这带来了什么问题

正因为内核和用户空间(TA)都在 ttbr0_el1 对应的低地址范围内混着,这就带来了巨大的安全隐患——Meltdown(熔断)漏洞

在没有开启 CFG_CORE_UNMAP_CORE_AT_EL0 之前:

  • 当 CPU 降权到 EL0 运行 TA 时,ttbr0_el1 指向的页表里,同时包含了 TA 的内存映射和 OP-TEE 内核的内存映射(只不过内核部分的页表属性被标记为了“仅 EL1 可访问”)。

  • 利用 Meltdown 漏洞,运行在 EL0 的恶意 TA 可以通过 CPU 的乱序执行和侧信道,直接窃取同在 ttbr0_el1 映射下的内核机密数据

为了解决这些问题,于是就有了我们前面看到的那段代码,使用"蹦床"代码来达到KPTI(内核页表隔离)的目的:

  1. 内核态页表:包含完整的内核 + 当前 TA。

  2. 用户态页表:只包含 TA + 极少量的内核异常处理蹦床代码(Reduced Mapping)。

因为它们都得用 ttbr0_el1,所以当代码从内核(EL1)准备返回到 TA(EL0)时,必须通过那句 msr ttbr0_el1, x0,强行把 ttbr0_el1 从内核态页表切换成用户态页表

由于换页表时 PC(程序计数器)还在运行,为了不让自己脚下的地基(页表)突然消失,才演变出了那段利用 br x1的精妙设计。

下面我们来深入分析一下,并重点剖析 br x1 这行精妙设计的意图。

br x1 的设计意图

在开启了内核页表隔离后,内核存在两套虚拟地址映射

  1. Full Mapping(完整映射):内核态正常运行时的映射,能看到整个内核内存。

  2. Reduced Mapping(简化/蹦床映射):专门为了在 EL0 下运行而保留的极简映射。这个映射的虚拟地址通常有一个固定的偏移量(Offset)。

/* Jump into the reduced mapping and continue execution */        adr_l        x1, 1f        sub        x1, x1, x0        br        x11:

为什么要用 br x1 进行绝对跳转?

如果我们不进行跳转,直接执行标号1f处的代码,当下一阶段修改 ttbr0_el1(切换页表)时,当前正在执行的代码所在的完整映射页表会被瞬间销毁。如果 CPU 还在旧的虚拟地址上取指令,会立刻触发 Instruction Abort(指令访问异常) 导致系统崩溃。

因此,代码必须在切换页表之前,将 CPU 的程序计数器(PC)移动到“简化映射”所对应的虚拟地址空间

这里的数学逻辑

  • adr_l x1, 1f:获取当前完整映射下,标签 1: 的绝对虚拟地址

  • sub x1, x1, x0x0 保存的是两个映射之间的地址偏移量(thread_user_kcode_offset)。减去这个偏移量后,x1 变成了标签 1: 在简化映射下的虚拟地址

  • br x1:间接跳转到简化映射下的 1:

惊艳的“平滑过渡”

因为这两段代码在物理上/或在简化的虚拟空间里的相对位置完全一致(同一段代码被映射了两次),所以当执行 br x1 时:

  • 从 CPU 的视角看:PC 指针“跳”到了另一个地址(Reduced 空间)。

  • 从代码逻辑看:它正好落在了下一行指令 1: BTI(bti j) 上。

此时,CPU 已经安全地在 Reduced Mapping 的地址空间里跑了。接下来就算立刻把 Full Mapping 的页表卸载掉(修改 ttbr0_el1),PC 所在的地址依然是合法有效的!

逐段详细代码分析

我们可以把整段代码分为四个阶段:

阶段一:调整异常向量表与计算偏移

eret_to_el0:        pauth_el1_to_el0 x1  /* 指针身份验证相关的安全宏(若开启了 PAC) */#ifdef CFG_CORE_UNMAP_CORE_AT_EL0        /* 1. 获取完整映射与简化映射之间的地址偏移量 */        adr_l        x0, thread_user_kcode_offset        ldr        x0, [x0]        /* 2. 降低 VBAR_EL1,确保在 EL0 发生中断回到 EL1 时,              异常向量表在 Reduced Mapping 空间也是可访问的 */        mrs        x1, vbar_el1        sub        x1, x1, x0        msr        vbar_el1, x1        isb

阶段二:跃迁到简化映射空间

#ifdef CFG_CORE_WORKAROUND_SPECTRE_BP_SEC        /* 临时借用 tpidr_el1 寄存器保存栈偏移,用于防御 Spectre 变体 */        adr_l        x1, thread_user_kdata_sp_offset        ldr        x1, [x1]        msr        tpidr_el1, x1#endif        /* 运用上文分析的逻辑,平滑跃迁 PC 到 Reduced 空间 */        adr_l        x1, 1f        sub        x1, x1, x0        br        x11:        BTI(        bti        j) /* 分支目标识别(Branch Target Identification),防御 JOP 攻击 */

阶段三:切断内核映射

/* 临时保存寄存器 */        load_xregs sp, THREAD_CORE_LOCAL_X0, 01        msr        tpidrro_el0, x0        /* 【核心安全操作】修改页表基地址寄存器 ttbr0_el1 */        mrs        x0, ttbr0_el1        add_imm        x0, __CORE_MMU_BASE_TABLE_OFFSET /* 切换到只包含用户态和蹦床代码的页表 */        orr        x0, x0, #BIT(TTBR_ASID_SHIFT)        /* 切换到用户态的 ASID,刷新 TLB 隔离 */        msr        ttbr0_el1, x0        isb /* 指令同步隔离,确保页表修改立即生效 */

阶段四:恢复现场并返回 EL0

#ifdef CFG_CORE_WORKAROUND_SPECTRE_BP_SEC        /* 恢复并调整影子栈指针 SP,防止通过栈进行 Spectre 边界推测攻击 */        mrs        x0, tpidr_el1        sub        sp, sp, x0#endif        mrs        x0, tpidrro_el0#else        /* 如果没有开启 CFG_CORE_UNMAP_CORE_AT_EL0 (未开启 KPTI)           逻辑非常简单,只需要切换 ASID,然后直接恢复现场即可 */        mrs        x0, ttbr0_el1        orr        x0, x0, #BIT(TTBR_ASID_SHIFT)         msr        ttbr0_el1, x0        isb        load_xregs sp, THREAD_CORE_LOCAL_X0, 01#endif        return_from_exception /* 执行 ERET 恢复 PSTATE,正式降权返回到 EL0 用户态 */

总结

这段代码是 OP-TEE 里面最底层、要求最苛刻的汇编之一。

br x1 的根本目的,就是在解绑内核页表前,完成执行流自身的“金蝉脱壳”。通过将 PC 巧妙地替换为另一套相同映射下的虚拟地址,使得接下来的页表切换不会引发 CPU 自身的取指崩溃,从而优雅、安全地实现了内核与用户态的完全隔离。