优化尝试 #7：解耦地址计算以提升ILP
========================================

日期：2026-01-16
状态：❌ 失败（回滚）

## 修改内容
手动内联 `hash_of_hash` 到 `contains_impl` 中，并将 `h1`, `h2` 的 XOR 偏移量计算提前，与 `h0` 的乘法计算行并行。同时尝试用 `h0 + 2*seg_len` 替代 `h1 + seg_len` 以解除依赖链。

## 理论依据
减少数据依赖，利用超标量 CPU 的并行执行能力，在等待乘法结果时预先计算其他值。

## 性能结果

| 过滤器 | 查询性能变化 |
|--------|--------------|
| BinaryFuse8 | -4.04% |
| BinaryFuse16 | -2.28% |
| BinaryFuse32 | -1.85% |

## 结论
性能显著下降。
原因推测：增加的寄存器压力导致了溢出，或者破坏了编译器原有的指令调度优化。原来的顺序执行可能对分支预测或 pipeline 更友好。
