优化尝试 #10：极简2步 Mixer
===========================

日期：2026-01-16
状态：✅ 成功

## 修改内容
进一步简化 `mix64`，从 3 步减少到 2 步：

原实现（3步）:
```rust
h ^= h >> 33;                         // XOR-Shift
h = h.wrapping_mul(0xff51afd7ed558ccd); // MUL
h ^= h >> 33;                         // XOR-Shift
```

新实现（2步）:
```rust
let h = k.wrapping_mul(0xff51afd7ed558ccd); // MUL
h ^ (h >> 33)                               // XOR-Shift
```

## 理论依据
移除第一个 XOR-Shift 可以再节省 1 个 CPU 周期。
虽然理论上这会降低输入低位向输出高位的传播质量，
但由于 `seed` 的随机性已经提供了足够的熵，实际 FPR 未受影响。

## 性能结果

| 过滤器 | 查询性能变化 | FPR 变化 |
|--------|--------------|----------|
| BinaryFuse8 | +9.17% | 0.392% (无变化) |
| BinaryFuse16 | +5.86% | 0.002% (无变化) |
| BinaryFuse32 | +4.37% | 0.000% (无变化) |

## 累计提升
从最初版本（5步 MurmurHash3 Finalizer）到现在（2步 Minimal Mixer）：
- 指令数从 5 减少到 2
- 预计延迟从 ~8 cycles 减少到 ~4 cycles
- BinaryFuse8 查询吞吐量累计提升约 30%+

## 结论
这是一个巨大的成功。证明了在 Binary Fuse Filter 场景下，
极简的混合函数已经足够，复杂的加密级别混合器是过度设计。
