    Finished `test` profile [unoptimized + debuginfo] target(s) in 0.21s
     Running tests/label_precision_benchmark.rs (target/debug/deps/label_precision_benchmark-37564da61aef374d)

running 1 test
label_precision_benchmark: model=qwen2.5:14b
label_precision_benchmark: Engine::new receives Arc<Ollama> directly (NO ArcChatProvider wrapper). fn model() should return: 'qwen2.5:14b'
test label_precision_gte_0_75_on_mock_interview has been running for over 60 seconds
  extracted: 'Amazon' (id='amazon') label='Organisation'
  extracted: 'Amazon Robotics”, ' (id='amazon robotics') label='Entity'
  extracted: 'Amazon Robotics", "entity_type_id": 2}, {' (id='amazon robotics entitytypeid 2') label='Entity'
  extracted: 'Boston”, ' (id='boston') label='Entity'
  extracted: 'Boston Consulting Group”, ' (id='boston consulting group') label='Entity'
  extracted: 'Boston Consulting Group", "entity_type_id": 2}]}<tool_call><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|>' (id='boston consulting group entitytypeid 2toolcallimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstartimstart') label='Entity'
  extracted: 'Boston", "entity_type_id": 3}, {' (id='boston entitytypeid 3') label='Entity'
  extracted: 'Morocco”, ' (id='morocco') label='Entity'
  extracted: 'Morocco", "entity_type_id": 3}, {' (id='morocco entitytypeid 3') label='Entity'
  extracted: 'Northeastern University”, ' (id='northeastern university') label='Entity'
  extracted: 'Northeastern University", "entity_type_id": 2}, {' (id='northeastern university entitytypeid 2') label='Entity'
  extracted: 'Ria”, ' (id='ria') label='Entity'
  extracted: 'Ria", "entity_type_id": 1}, {' (id='ria entitytypeid 1') label='Entity'
label_precision: 20.0% (2/10 ground-truth name+label pairs matched)
  12 non-canonical labels (TD-012 indicator)
  non-canonical entities: [("Amazon Robotics”, ", "Entity"), ("Amazon Robotics\", \"entity_type_id\": 2}, {", "Entity"), ("Boston”, ", "Entity"), ("Boston Consulting Group”, ", "Entity"), ("Boston Consulting Group\", \"entity_type_id\": 2}]}<tool_call><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|><|im_start|>", "Entity"), ("Boston\", \"entity_type_id\": 3}, {", "Entity"), ("Morocco”, ", "Entity"), ("Morocco\", \"entity_type_id\": 3}, {", "Entity"), ("Northeastern University”, ", "Entity"), ("Northeastern University\", \"entity_type_id\": 2}, {", "Entity"), ("Ria”, ", "Entity"), ("Ria\", \"entity_type_id\": 1}, {", "Entity")]

── PHASE 1 DIAGNOSTIC: Metrics snapshot ──
  rql.entity.label_rejected_total: NO REJECTIONS RECORDED
  Other rql.* counters in snapshot:
    rql.entity_types.default_seed_applied [("group_id", "default")] = 1
    rql.db.insert_episode_with_group_ms [] = 0
    rql.ingest.chunk_count [] = 0
    rql.db.list_entities_count [] = 0
    rql.db.list_entities_ms [] = 0
    rql.extraction.structured_call_attempt [("schema", "EntityListIntegerId"), ("arm", "format_schema"), ("model", "qwen2.5:14b")] = 3
    rql.extraction.repair_attempt [("schema", "unknown"), ("arm", "llm_json")] = 1
    rql.extraction.structured_call_success [("schema", "EntityListIntegerId"), ("arm", "format_schema")] = 2
    rql.extraction.stage_ms [("stage", "entities")] = 0
    rql.extraction.json_parse_ok [] = 9
    rql.extraction.structured_call_attempt [("schema", "RelTypeList"), ("arm", "format_schema"), ("model", "qwen2.5:14b")] = 3
    rql.extraction.structured_call_success [("schema", "RelTypeList"), ("arm", "format_schema")] = 3
    rql.extraction.stage_ms [("stage", "relations")] = 0
    rql.extraction.structured_call_attempt [("schema", "TripletList"), ("arm", "format_schema"), ("model", "qwen2.5:14b")] = 3
    rql.extraction.fallback_ladder_step [("schema", "TripletList"), ("from_arm", "format_schema"), ("to_arm", "llm_json_repair"), ("model", "qwen2.5:14b")] = 1
    rql.extraction.structured_call_attempt [("schema", "TripletList"), ("arm", "llm_json_repair"), ("model", "qwen2.5:14b")] = 1
    rql.extraction.structured_call_success [("schema", "TripletList"), ("arm", "llm_json_repair")] = 1
    rql.extraction.stage_ms [("stage", "triplets")] = 0
    rql.extraction.entity_count [] = 0
    rql.extraction.fact_count [] = 0
    rql.extraction.structured_call_success [("schema", "TripletList"), ("arm", "format_schema")] = 2
    rql.extraction.fallback_ladder_step [("schema", "EntityListIntegerId"), ("from_arm", "format_schema"), ("to_arm", "llm_json_repair"), ("model", "qwen2.5:14b")] = 1
    rql.extraction.structured_call_attempt [("schema", "EntityListIntegerId"), ("arm", "llm_json_repair"), ("model", "qwen2.5:14b")] = 1
    rql.extraction.structured_call_success [("schema", "EntityListIntegerId"), ("arm", "llm_json_repair")] = 1
    rql.db.insert_entity_with_group_ms [] = 0
    rql.db.set_entity_embedding_ms [] = 0
    rql.db.insert_episodic_edge_ms [] = 0
    rql.search.fts_facts_hits [] = 0
    rql.search.fts_facts_ms [] = 0
    rql.db.insert_fact_ms [] = 0
    rql.extraction.structured_call_attempt [("schema", "ContradictionVerdict"), ("arm", "format_schema"), ("model", "qwen2.5:14b")] = 1
    rql.extraction.structured_call_success [("schema", "ContradictionVerdict"), ("arm", "format_schema")] = 1
    rql.db.invalidate_fact_with_reason_ms [] = 0
    rql.ingest.total_ms [] = 0
    rql.ingest.entity_count [] = 0
    rql.ingest.fact_count [] = 0
    rql.ingest.merge_count [] = 0
    rql.ingest.contradiction_count [] = 0
    rql.db.get_entity_ms [] = 0
── END DIAGNOSTIC ──


thread 'label_precision_gte_0_75_on_mock_interview' (10107246) panicked at crates/kremory/tests/label_precision_benchmark.rs:382:5:
label_precision 20.0% (2/10) is below the 65% R1 threshold.
Pre-Phase-4 (TD-012 broken state) produces ≈ 0%. Post-L1+L2+L3 target >= 65%.
12 entities had non-canonical labels.
Check: StructuredCallBuilder FormatSchema arm is active for model 'qwen2.5:14b'.
note: run with `RUST_BACKTRACE=1` environment variable to display a backtrace
test label_precision_gte_0_75_on_mock_interview ... FAILED

failures:

failures:
    label_precision_gte_0_75_on_mock_interview

test result: FAILED. 0 passed; 1 failed; 0 ignored; 0 measured; 5 filtered out; finished in 322.14s

error: test failed, to rerun pass `-p kremory --test label_precision_benchmark`
