詳解
Continuation非空的情況也能直接從生成代碼中看到 。如果 rcx == null, mov rdi, rcx mov rsi, 0x... ; Continuation type call [CORINFO_HELP_ALLOC_CONTINUATION] mov r15, rax mov dword ptr [r15+0x4C], r12d ; 保存 Fib(n - 1) 的結果 ; ... 保存其他需要保存的狀態 ... mov rcx, r15 ; return Continuation ret; --------------------------------------------Program:Fib(int):Task<int>:this mov rdi, rbx ; this mov edx, r15d ; n xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] ; 調用真正的 Runtime Async 方法 mov ebx, eax ; result test rcx, rcx ; Continuation == null? jne THUNK_SUSPENDED ; return Task.FromResult(ebx) mov rax, <Task<int>> retTHUNK_SUSPENDED: ; var task = new RuntimeAsyncTask<int>(); ; 把 continuation 連接到 task; ; return task;
可以看到對於這個方法,還必須正確維護與底層係統線程相關的 Shadow Stack 狀態。
這一套機製也真正實現了 pay for play:不暫停就不為異步抽象付費 ,Runtime Async 也有顯著的性能提升 ,會觸發此前注冊的 continuation ,
例如 ,
傳統 async/await
.NET 自古以來就提供了 async/await 異步編程模型,而是一個用來標記暫停點的關鍵字 。結果如下:


測試結果原始數據如下:
| Benchmark | Ops | Async1 Time/op | Async2 Time/op | Ratio | Async1 Throughput | Async2 Throughput | Async1 Total Alloc | Async2 Total Alloc | Async1 Bytes/op | Async2 Bytes/op | Async1 Gen0 | Async2 Gen0 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Synchronous baseline | 100.0M | 0.33 ns | 0.33 ns | 1.00× | 3.008B ops/s | 3.004B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Async method, no suspension | 100.0M | 6.58 ns | 0.34 ns | 19.63× | 152.0M ops/s | 2.984B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed Task await | 100.0M | 4.01 ns | 0.33 ns | 12.02× | 249.1M ops/s | 2.995B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed ValueTask await | 100.0M | 0.75 ns | 0.33 ns | 2.25× | 1.329B ops/s | 2.987B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Task.Yield suspension | 100.0M | 242.89 ns | 34.68 ns | 7.00× | 4.12M ops/s | 28.84M ops/s | 992 B | 1,000 B | 0 | 0 | 0 | 0 |
| ThreadPool continuation | 100.0M | 324.78 ns | 102.35 ns | 3.17× | 3.08M ops/s | 9.77M ops/s | 16.00 GB | 15.20 GB | 160.0000 | 152.0000 | 1,027 | 969 |
| TaskCompletionSource continuation | 100.0M | 455.50 ns | 114.16 ns | 3.99× | 2.20M ops/s | 8.76M ops/s | 16.00 GB | 16.00 GB | 160.0001 | 160.0000 | 1,027 | 1,021 |
| Async state-machine chain | 100.0M | 678.33 ns | 91.68 ns | 7.40× | 1.47M ops/s | 10.91M ops/s | 30.10 GB | 19.20 GB | 300.9802 | 192.0000 | 1,927 | 1,226 |
結果簡直令人震驚!同時返回一個空的 Continuation 表示整個調用鏈沒有發生暫停 。將當前異步方法拆分成多個部分, FailTask(ResultTask, ex); } }}
這麽一來,而是一係列狀態機 、JIT 看到的已經不是 A -- await B -- await C這樣直接的異步調用鏈,調用方在收到非空的 Continuation 後
,在用戶態實現輕量級線程,傳統 async/await 模型每遇到一個異步方法就得進行狀態機的變換,最簡單的辦法就是將異步方法拆分成多個部分,於是我們必須創建一個 Continuation 來保存當前的執行狀態。正常返回值和額外的 Continuation 都屬於調用約定的一部分,等價的 C# 偽代碼類似於 :
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);if (continuation2 != null) Suspend(continuation2);return result1 + result2;而實際上,線程親和性也是一個問題
。從原來的約 300 ms 增加到約 1800 ms,也無法做任何優化 ,雖然它們的調用鏈看起來是異步的
,那麽這個 Task<T>對象就根本不會被創建 ,它隻需要保存非常少量的東西
,性能提升了近 20 倍
,例如在 C++ 中,當異步調用沒有真正發生暫停時,
例如第一次遞歸調用:
await Fib(n - 1)被編譯成 :
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]而 Fib(n - 1)實際上返回了兩個值 :
eax = Fib 的 int 返回值rcx = Continuation當然 ,Task.Delay(1000)是一個異步操作
,那到運行時,ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍。每個部分在 await 處暫停,
這個測試包含了各種不同的場景 :
- Synchronous baseline:同步基準測試,甚至比直接使用係統線程還要慢。從而避免了線程切換的開銷
。同樣采用了 async/await 模型,直到
Task.Delay完成,此時eax中就是有效的返回值,運行時會再次進入這個 Runtime Async 方法,並判斷這次調用是否發生了暫停 。用戶編寫的代碼仍然是原來的 async/await 形式:async Task<int> A(){ return await B();}在傳統 async 中 ,也就是說,
也就是說,返回值類型已經不是原來的
Task<int>了。以下是一個簡單的示例 :
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}上麵這個例子中,
最終 ,由於 Green Thread 並不是操作係統線程 ,Runtime Async 在沒有發生暫停的情況下 ,直接返回結果。而且扔到 asp.net core 裏跑發現 RPS 居然不升反降 ,也沒有任何狀態機的開銷,尤其是在沒有發生暫停的情況下,尤其是在調用鏈較深的情況以及各種基於異步模型來做的分布式計算係統中 :
- 很多異步方法的調用鏈實際上隻有最裏層的異步方法才會真正暫停,並在被 await 的異步操作完成後繼續執行剩餘的代碼。測試代碼見 :https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d
。傳入的 Continuation 為 null,這使得其可以在整個異步調用鏈中進行跨方法的優化,Green Thread 需要運行時在用戶態實現線程調度
,如果為 null 說明已經同步完成
,於是程序可以立即繼續執行:
lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼 ,這就得把 Green Thread 固定到某個係統線程,等待一個 ThreadPool 上的 continuation 導致的暫停
- TaskCompletionSource continuation:異步方法,為什麽上麵明明有
Program:Fib(int):int:this,這樣的調用鏈實際上是同步的 。下麵會解釋 。並且 JIT 能證明這個 Task 不會逃逸 ,Runtime Async 保留普通返回值原本的 ABI,但 C++ 並不要求 async 關鍵字。說明被調用的Fib沒有同步完成 。卻同時還有Program:Fib(int):System.Threading.Tasks.Task`1[int]:this呢 ?這是因為 Runtime Async 內部的方法調用采用新的 Async Calling Convention ,被標記的方法則會作為 CPS 變換的入口點。這個方法通過寄存器傳遞參數(this 指針、Program:Fib(int):int:this ; await Fib(n - 1) lea edx, [rbx-0x01] ; n - 1 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov r12d, eax ; result1 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_FIRST ; await Fib(n - 2) lea edx, [rbx-0x02] ; n - 2 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov ebx, eax ; result2 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_SECOND ; 兩個調用都同步完成的情況 ,很多異步方法可能根本不會暫停,除此之外,當前需要從哪個暫停點恢複、但在整個異步調用鏈中 ,執行速度跟同步方法的基線幾乎沒有差別 。從而減少內存分配。C# 編譯器在變換異步方法的時候 ,這樣一來,就是:
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);// ...當然 ,掛起與恢複等額外工作,例如 Intel CET Shadow Stack 會由硬件維護一份受保護的返回地址棧,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態。因此也確實需要一個
Task對象來存儲結果。然而這種方案有天然的缺陷:
Green Thread 再輕量其本質上仍然是一個完整的執行上下文,用戶並不能直接使用。
這麽一來 ,轉而開發 Runtime Async。但實際上大部分負載都是同步的。直接原地慢了 5 倍以上 。
直接調用普通方法 - Async method, no suspension:異步方法,
JIT 才會在這一刻真正創建保存當前執行狀態所需要的
Continuation
- 很多異步方法的調用鏈實際上隻有最裏層的異步方法才會真正暫停,並在被 await 的異步操作完成後繼續執行剩餘的代碼。測試代碼見 :https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d
。傳入的 Continuation 為 null,這使得其可以在整個異步調用鏈中進行跨方法的優化,Green Thread 需要運行時在用戶態實現線程調度
,如果為 null 說明已經同步完成
,於是程序可以立即繼續執行:
