    Finished `test` profile [unoptimized + debuginfo] target(s) in 0.28s
     Running tests/rqlm_gemma4_e2e.rs (/Users/jamessheen/.cargo-shared-target/kaironiq/debug/deps/rqlm_gemma4_e2e-299beea292e48249)

running 1 test
[ingest] entities_added=1 edges_added=2 facts_invalidated=0 duration_ms=34
[search] hits=1 for query="What's our streaming TTS latency budget?"
  entity_id=ws-rqlm-gemma4-e2e:document:latency-budget-q4 score=0.0164 summary_preview="# Q4 Latency Budget — Streaming TTS\n\nCurrent end-to-end latency breakdown for st"
[context_block] template=Entities chars=452 preview="## document\n# Q4 Latency Budget — Streaming TTS\n\nCurrent end-to-end latency breakdown for streaming text-to-speech:\n- Te"
[context_block] template=EdgeSummary chars=40 (empty OK if source_refs unset by D.5b)
[context_block] template=TemporalFacts chars=460 (empty OK if source_refs unset by D.5b)
[       0.0ms] [synth       ] AA_PROVIDER_BUILT elapsed=2596ms n_ctx=8192 max_tokens=1024 temp=0.10
[ok] loaded synthesiser: /Users/jamessheen/Documents/Projects/Ideas/ai-meeting-transcription/models/gemma-4-E2B-it-Q4_K_M.gguf
[synthesise] user_query="What's our streaming TTS latency budget?" chunks=1 chunk0_chars=403
[    2184.1ms] [synth       ] AA_SYNTH_DONE total=2176.5ms tokens≈82 cached_prefix=219
[synthesise] answer_len=419 chars
[synthesise] answer:
The current end-to-end latency breakdown for streaming text-to-speech is as follows:

*   Text normalisation: 12ms
*   Phoneme conversion (G2P): 8ms
*   Acoustic model (first chunk): 45ms
*   Vocoder (first chunk): 22ms
*   Network overhead (WebSocket): 15ms

The total first-byte latency is **102ms**, with a target of less than 150ms.

The P99 latency spike issue from October was traced to the batch scheduler queue.

[grounded] cited_tokens=["102", "150"] — rqlm Kaironiq path verified end-to-end through Gemma 4
test rqlm_kaironiq_path_grounds_chat_via_gemma4 ... ok

test result: ok. 1 passed; 0 failed; 0 ignored; 0 measured; 0 filtered out; finished in 5.01s

/Users/jamessheen/.cargo/registry/src/index.crates.io-1949cf8c6b5b557f/llama-cpp-sys-2-0.1.146/llama.cpp/ggml/src/ggml-metal/ggml-metal-device.m:612: GGML_ASSERT([rsets->data count] == 0) failed
WARNING: Using native backtrace. Set GGML_BACKTRACE_LLDB for more info.
WARNING: GGML_BACKTRACE_LLDB may cause native MacOS Terminal.app to crash.
See: https://github.com/ggml-org/llama.cpp/pull/17869
0   rqlm_gemma4_e2e-299beea292e48249    0x00000001003f394c ggml_print_backtrace + 276
1   rqlm_gemma4_e2e-299beea292e48249    0x000000010238e8f0 ggml_abort + 156
2   rqlm_gemma4_e2e-299beea292e48249    0x00000001004e2f04 ggml_metal_device_init + 0
3   rqlm_gemma4_e2e-299beea292e48249    0x00000001004e384c ggml_metal_device_free + 24
4   rqlm_gemma4_e2e-299beea292e48249    0x00000001004e4f60 _ZNSt3__16vectorINS_10unique_ptrI17ggml_metal_device25ggml_metal_device_deleterEENS_9allocatorIS4_EEED1B9nqe210106Ev + 72
5   libsystem_c.dylib                   0x0000000186f8b42c __cxa_finalize_ranges + 480
6   libsystem_c.dylib                   0x0000000186f8b1ec exit + 44
7   libdyld.dylib                       0x0000000186cd7fc8 _ZNK5dyld416LibSystemHelpers6getenvEPKc + 0
8   dyld                                0x0000000186d0df04 _ZNK5dyld423LibSystemHelpersWrapper4exitEi + 172
9   dyld                                0x0000000186d0dd84 start + 7232
