workload YAML + HCOMM LLVM bitcode
			   |
			   v
materialize_workload
选择 hcomm-c220-alltoall-urma 实现
补齐 ABI、内存、RMA 队列、launch、rank/block
			   |
			   v
resolved-case.json
			   |
			   v
LLVM analyzer
解析 aiv_all_to_all_half 的 CFG、SSA、intrinsic
			   |
			   v
static-kernel.*.json
			   |
			   v
bind_case + execute_bound_case
分别执行 2 rank × 2 block 的具体控制流
			   |
			   v
core-executions.json
			   |
			   v
lower_collective_trace
识别 URMA WQE/doorbell、轮询、同步和依赖
			   |
			   v
collective-trace.json


16、32 rank 的 collective-trace.json 不是从真实 HCOMM LLVM 推导出来的，也不是把 2-rank JSON 复制放大。它们由项目里的 synthetic ring 生成器直接按公式构造：

src/collective_llvm_trace/synthetic/ring_allreduce.py:58

SyntheticRingConfig
rank_count
elements_per_rank
tag
	  ↓
generate_synthetic_ring_allreduce()
	  ↓
直接创建 CollectiveTraceIR
	  ↓
collective-trace.json

它跳过了这几步：

LLVM analyzer
StaticKernelIR
BoundCaseIR
CoreExecutionIR
