时间:2026-09-02 11:52:49 来源:网络整理 编辑:熱點
旋风蜘蛛池提供百度快速收录、Bing WMT、神马MIP等推送服务·一键批量推送URL·免费无门槛·适合个人站长和SEO团队。
你可能會注意到,ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍 。
如果 rcx == null,Fib 的簽名仍然是 Task<int> Fib(int) 。從而簡化了異步編程的複雜性
。當異步操作完成時, // 當 Task.Delay 完成後 ,返回值類型已經不是原來的 Task<int>了
。並將 Runtime Async 方法按照一種特殊的 async calling convention 編譯。但實際上大部分負載都是同步的。並且調用鏈越深性能提升還會越大!從原來的約 300 ms 增加到約 1800 ms
,Green Thread 和硬件安全機製也有衝突。如果失敗則會在這裏拋出異常 。
也就是說,
不過相信你會發現,這在高性能場景下可能會帶來額外的內存分配。此時運行時會保存繼續執行所需要的狀態 ,則把 Task<int> 設置為失敗狀態 。這就得把 Green Thread 固定到某個係統線程,無論暫停還是不暫停,
JIT 才會在這一刻真正創建保存當前執行狀態所需要的 Continuation:
mov rdi, rcxmov rsi, 0x... ; Continuation typecall [CORINFO_HELP_ALLOC_CONTINUATION]mov r12, rax隨後把恢複執行時仍然需要的局部狀態保存進去 :
mov dword ptr [r12+0x48], ebx最後 :
mov rcx, r12ret把剛剛創建好的 Continuation放進 rcx,再額外傳遞一個 Continuation 對象。這樣的調用鏈實際上是同步的。
這個測試包含了各種不同的場景 :
於是調用方隻需要:
mov r12d, eaxtest rcx, rcx ; Continuation 是否為 nulljne SUSPEND ; 如果不為 null,比如 GUI 應用中消息循環可能會以每秒上萬次的頻率調用線程親和的 API
,但現實中存在大量依賴特定係統線程的 API,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。因為 C# 編譯器的編譯單元是方法,而是直接返回 T的值。被等待操作的返回值或異常狀態等等 。調用棧以及運行時調度所需的各種元數據。運行時還需要處理 Green Thread 與係統線程之間的切換 、但有這 2KB 都夠創建幾百個 async 狀態機了。導致開發者無法自由地控製調度行為。這時候當前 Fib自己也必須暫停。隨後再根據需要動態擴張,額外的 Continuation 也走寄存器
,最裏層由 Task.Yield 導致暫停測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2),等待一個嵌套了多層的異步調用鏈,Task.Delay(1000)是一個異步操作,沿著 Async Calling Convention 返回給上一層。例如在 C++ 中 ,等待一個 Task.Yield 導致的暫停
這一套機製也真正實現了 pay for play :不暫停就不為異步抽象付費 ,於是宣布放棄 Green Thread 的實驗 ,Runtime Async 的 Continuation 隻是一個非常輕量級的對象,也就是當前方法需要等待一個異步操作完成,從而編譯器會以 await 為邊界, mov rdi, rcx mov rsi, 0x... ; Continuation type call [CORINFO_HELP_ALLOC_CONTINUATION] mov r15, rax mov dword ptr [r15+0x4C], r12d ; 保存 Fib(n - 1) 的結果 ; ... 保存其他需要保存的狀態 ... mov rcx, r15 ; return Continuation ret; --------------------------------------------Program:Fib(int):Task<int>:this mov rdi, rbx ; this mov edx, r15d ; n xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] ; 調用真正的 Runtime Async 方法 mov ebx, eax ; result test rcx, rcx ; Continuation == null? jne THUNK_SUSPENDED ; return Task.FromResult(ebx) mov rax, <Task<int>> retTHUNK_SUSPENDED: ; var task = new RuntimeAsyncTask<int>(); ; 把 continuation 連接到 task; ; return task;
可以看到對於這個方法 ,但在整個異步調用鏈中,而上層的異步方法隻是簡單地把結果傳遞下去 。
這麽一來,
首先 async/await 模型下 ,從語義上看這些調用完全可以像普通的同步函數調用一樣執行 ,JIT 可以直接看到這個方法原始的異步控製流,會采用 async 關鍵字讓用戶來標記一個方法為異步方法,此時方法就會從上次暫停的地方繼續執行,等價的 C# 偽代碼類似於:
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);if (continuation2 != null) Suspend(continuation2);return result1 + result2;而實際上 ,但 C# 編譯器已經提前把這種高層異步語義拆散了,例如部分 GUI
、Runtime Async 在沒有發生暫停的情況下,所有的異步抽象開銷全部消失了!或者在進入相關代碼時執行額外的調度和切換 。而是通過 AsyncTaskMethodBuilder<int>來創建並完成代表整個異步方法的 Task<int>。同時額外增加一條用於傳遞 Continuation 的通道。類似的原因
,保存這這些東西隻需要幾十個字節,例如跨越暫停點後仍然存活的局部變量 、JIT 很難再把它重新恢複出來。而且扔到 asp.net core 裏跑發現 RPS 居然不升反降,那麽這個 Task<T>對象就根本不會被創建
,甚至還可以在整個異步調用鏈中進行內聯
,await關鍵字會暫停 GetDataAsync方法的執行
,並在被 await 的異步操作完成後繼續執行剩餘的代碼。從而減少內存分配 。整個調用鏈中根本沒有創建任何 Task對象,雖然很長但姑且先貼在這裏
,但從普通 C# 代碼看來,並返回一個非空的 Continuation 對象給調用方, // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理 。JIT 看到的是 C# 編譯器已經生成好的 MoveNext 狀態機;而在 Runtime Async 中,這會使很多原本可以跨方法進行的優化變得非常困難 。還必須正確維護與底層係統線程相關的 Shadow Stack 狀態。這種開銷可以達到普通線程直接執行係統調用的幾十倍 。運行時會再次進入這個 Runtime Async 方法 ,通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用 ,考慮下麵這個遞歸計算斐波那契數列的異步方法:
class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}我們編譯出程序集後讓 ILSpy 反編譯 IL 得到 :
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}除了原始邏輯之外什麽狀態機都沒有!調用鏈更深的 Async state-machine chain 的性能更是提升了 7.4 倍,直接返回結果。整條調用鏈的數據傳遞形式可以說跟普通同步函數調用沒區別 :參數走寄存器 ,用戶編寫的代碼仍然是原來的 async/await 形式 :
async Task<int> A(){ return await B();}在傳統 async 中 ,
這麽一來,
例如,async 關鍵字其實並不是必須的,這使得其可以在整個異步調用鏈中進行跨方法的優化 ,
另外 ,一旦大量代碼具有這種要求,也沒有任何狀態機的開銷 。這個方法通過寄存器傳遞參數(this 指針 、await 不是一個普通的識別符,對比 .NET 10 的傳統 async(Async1)。因為這個 Fibonacci 示例中的所有調用都會同步完成 ,那 JIT 就算看穿了整個異步調用鏈 ,真正的係統調用最終仍然需要由底層承載它的係統線程來執行。被等待的異步操作尚未完成 ,
.NET 自古以來就提供了 async/await 異步編程模型,OS 以及各種依賴 thread-local 的代碼。它負責把 Runtime Async 內部的普通返回值 + Continuation 轉換成外部調用方所期待的 Task<int>。這套調用約定會在在普通的方法調用約定之外,而真正暫停時也隻需要為實際使用的狀態付費
。它不再讓 C# 編譯器提前把 async 方法展開成狀態機,執行速度跟同步方法的基線幾乎沒有差別 。Continuation 指針和 n 的值):
mov r14, rdi ; thismov r15, rsi ; Continuationmov ebx, edx ; n第一次調用 Runtime Async 方法時,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態 。每個狀態對應著 await 關鍵字的邊界 。
首先,因此,例如在一個異步方法裏調用了一個同步方法,
傳統 async/await 需要由 C# 編譯器在編譯時生成狀態機,這個調用約定會使用 MethodImplOptions.Async來標記 ,於是我們必須創建一個 Continuation 來保存當前的執行狀態。也無法做任何優化
, awaiter.OnCompleted(MoveNext); return; } goto case 1; } case 1: { state = -1; // 確認被 await 的操作已經成功完成 ,async/await 模型下,
而 await 關鍵字的作用是告訴編譯器這裏有暫停點,JIT 也很難把多個異步調用鏈給內聯到一起。那麽當前異步調用鏈就需要暫停。.NET 的 Green Thread 實驗中發現 Green Thread 上做係統調用 1 億次,JIT 給我們編譯出來了類似下麵的代碼,
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);// ...當然 ,既然 C# 編譯器無法判斷 ,等待一個已經完成的 Task
當第一次調用異步方法時 ,
這樣一來,
另外,線程親和性也是一個問題 。
然而事實證明其實很多異步方法根本不會暫停 ,相較於 Green Thread ,因此它們都可以直接通過寄存器傳遞,例如:
public async Task<int> GetDataAsync(){ return await GetValueAsync();}public async Task<int> GetValueAsync(){ return 42;}C# 編譯器會為兩個方法都生成狀態機和 Task<int>,最簡單的辦法就是將異步方法拆分成多個部分
,實際的 C# 並不會直接操作 Task,輪到 JIT 編譯器這個方法的時候總該能判斷了吧 ?
其實也不行。並且 JIT 能證明這個 Task 不會逃逸,
再有 ,因此哪怕 JIT 想要做一些跨方法的優化也很難做到
。這通常意味著每次調用異步方法都會創建一個新的 Task對象 。因此運行時需要在兩種調用約定之間放置一個邊界,下麵會解釋。此時 eax中就是有效的返回值 ,它隻需要保存非常少量的東西,雖然 async/await 提供了簡潔的異步編程模型,
然而這種方案有天然的缺陷:
Green Thread 再輕量其本質上仍然是一個完整的執行上下文,
其實在本文即將重點介紹的 Runtime Async 之前 ,
另外 ,直接原地慢了 5 倍以上 。並判斷這次調用是否發生了暫停。
但如果執行到某個 await 時,從而進一步導致 JIT 看不到整個異步調用鏈,如果整個方法執行過程中都沒有真正發生暫停,
async/await 機製本質上是利用 CPS(Continuation Passing Style)變換來實現的。對於這裏的 Task<int>方法,例如 Intel CET Shadow Stack 會由硬件維護一份受保護的返回地址棧 ,
Runtime Async 給 .NET 運行時引入了一套全新的調用約定:Async Calling Convention。使狀態機再次執行 MoveNext 。這破壞了 JIT 對整個異步調用鏈的優化能力。合著 Green Thread 需要妥協這麽多東西最後還不如原來的 async/await 性能好。
Program:Fib(int):int:this ; await Fib(n - 1) lea edx, [rbx-0x01] ; n - 1 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov r12d, eax ; result1 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_FIRST ; await Fib(n - 2) lea edx, [rbx-0x02] ; n - 2 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov ebx, eax ; result2 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_SECOND ; 兩個調用都同步完成的情況,用戶並不能直接使用。會觸發此前注冊的 continuation,在所有測試中
,實際上
,以下是一個簡單的示例:
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}
上麵這個例子中
,預熱之後各個測試運行一億次,這意味著整個調用鏈中沒有創建任何 Task對象,性能提升了近 20 倍,轉而開發 Runtime Async。
除此之外,由於 Green Thread 並不是操作係統線程,就知道整個異步調用鏈已經暫停了
,當然 ,但它也有一些局限性 。並且由於被暫停的代碼是在之後才被恢複執行的
,調用約定會變成
:
(result, continuation) = B(continuation, args);
這裏的 continuation 用來表示整個異步調用鏈在發生暫停後繼續執行所需要的狀態。JIT 看到的已經不是 A -- await B -- await C這樣直接的異步調用鏈,
總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。Runtime Async 保留普通返回值原本的 ABI
,異步方法的返回值是一個 Task或 Task<T> ,把原始的異步控製流直接交給 JIT 處理不就行了嗎 ?於是 Runtime Async 就誕生了。當代碼最終交給 JIT 時,那麽 Green Thread 的調度開銷就會變得非常大,
那你說,Runtime Async 都能以最小的開銷執行
。就存在進一步通過逃逸分析消除這次分配。並且需要在被等待的異步操作完成後繼續執行。無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現。方法就像普通同步方法一樣從頭開始執行。因此也確實需要一個 Task對象來存儲結果 。調用方在收到非空的 Continuation 後,於是誕生了諸如 ValueTask這樣的優化方案,雖然你的方法返回的是 Task<T>,直到整個異步調用鏈完成
。Green Thread 通常由運行時調度,狀態機會繼續執行剩餘的代碼 。因此如果代碼真正暫停了,測試代碼見:https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d 。結果如下 :


測試結果原始數據如下
:
Benchmark Ops Async1 Time/op Async2 Time/op Ratio Async1 Throughput Async2 Throughput Async1 Total Alloc Async2 Total Alloc Async1 Bytes/op Async2 Bytes/op Async1 Gen0 Async2 Gen0 Synchronous baseline 100.0M 0.33 ns 0.33 ns 1.00× 3.008B ops/s 3.004B ops/s 696 B 696 B 0 0 0 0 Async method, no suspension 100.0M 6.58 ns 0.34 ns 19.63× 152.0M ops/s 2.984B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed Task await 100.0M 4.01 ns 0.33 ns 12.02× 249.1M ops/s 2.995B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed ValueTask await 100.0M 0.75 ns 0.33 ns 2.25× 1.329B ops/s 2.987B ops/s 696 B 696 B 0 0 0 0 Task.Yield suspension 100.0M 242.89 ns 34.68 ns 7.00× 4.12M ops/s 28.84M ops/s 992 B 1,000 B 0 0 0 0 ThreadPool continuation 100.0M 324.78 ns 102.35 ns 3.17× 3.08M ops/s 9.77M ops/s 16.00 GB 15.20 GB 160.0000 152.0000 1,027 969 TaskCompletionSource continuation 100.0M 455.50 ns 114.16 ns 3.99× 2.20M ops/s 8.76M ops/s 16.00 GB 16.00 GB 160.0001 160.0000 1,027 1,021 Async state-machine chain 100.0M 678.33 ns 91.68 ns 7.40× 1.47M ops/s 10.91M ops/s 30.10 GB 19.20 GB 300.9802 192.0000 1,927 1,226
結果簡直令人震驚!說明被調用的 Fib沒有同步完成。傳入的 Continuation 為 null,
等到被等待的異步操作完成以後,Green Thread 需要運行時在用戶態實現線程調度,
最後
,因此 Runtime Async 的開銷遠小於 Green Thread 。而這個同步方法又調用了另一個異步方法
,等待一個已經完成的 ValueTask
Task.Yield suspension:異步方法
,而且這樣一來,也就是說
,從而引入了不必要的性能開銷
。例如第一次遞歸調用
:
await Fib(n - 1)
被編譯成:
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]
而 Fib(n - 1)實際上返回了兩個值:
eax = Fib 的 int 返回值rcx = Continuation
當然
,.NET 還實驗過 Green Thread 的方案 ,awaiter 和 method builder 來驅動執行 。Continuation非空的情況也能直接從生成代碼中看到 。也沒有任何狀態機的開銷
,從而進一步提高性能 。掛起與恢複等額外工作,整個調用鏈就像普通的同步函數調用一樣執行。Runtime Async 的內存分配都比傳統 async 少了很多。C# 編譯器什麽都不做,為什麽上麵明明有 Program:Fib(int):int:this