c889a57b6b
Test Suites / Build CI Environment (push) Has been cancelled
Test Suites / Basic Tests (push) Has been cancelled
Test Suites / End-to-End Tests (push) Has been cancelled
Test Suites / CLI Tests (push) Has been cancelled
Test Suites / Slow End-to-End Tests (push) Has been cancelled
Test Suites / Graph Database Tests (push) Has been cancelled
Test Suites / Vector DB Tests (push) Has been cancelled
Test Suites / Temporal Graph Test (push) Has been cancelled
Test Suites / Search Test on Different DBs (push) Has been cancelled
Test Suites / Example Tests (push) Has been cancelled
Test Suites / Notebook Tests (push) Has been cancelled
Test Suites / OS and Python Tests Ubuntu (push) Has been cancelled
Test Suites / OS and Python Tests Extended (push) Has been cancelled
Test Suites / LLM Test Suite (push) Has been cancelled
Test Suites / S3 File Storage Test (push) Has been cancelled
Test Suites / Run Integration Tests (push) Has been cancelled
Test Suites / MCP Tests (push) Has been cancelled
Test Suites / Docker Compose Test (push) Has been cancelled
Test Suites / Docker CI test (push) Has been cancelled
Test Suites / Relational DB Migration Tests (push) Has been cancelled
Test Suites / Distributed Cognee Test (push) Has been cancelled
Test Suites / DB Examples Tests (push) Has been cancelled
Test Suites / Test Completion Status (push) Has been cancelled
Test Suites / Claude Code Review (push) Has been cancelled
Test Suites / basic checks (push) Has been cancelled
build | Build and Push Cognee MCP Docker Image to dockerhub / docker-build-and-push (push) Has been cancelled
Scorecard supply-chain security / Scorecard analysis (push) Has been cancelled
build | Build and Push Docker Image to dockerhub / docker-build-and-push (push) Has been cancelled
Weighted Edges Tests / Test Weighted Edges Core Functionality (3.11) (push) Has been cancelled
Weighted Edges Tests / Test Weighted Edges Core Functionality (3.12) (push) Has been cancelled
Weighted Edges Tests / Test Weighted Edges with Different Graph Databases (kuzu, kuzu) (push) Has been cancelled
Weighted Edges Tests / Test Weighted Edges with Different Graph Databases (neo4j, neo4j) (push) Has been cancelled
Weighted Edges Tests / Test Weighted Edges Examples (push) Has been cancelled
Weighted Edges Tests / Code Quality for Weighted Edges (push) Has been cancelled
47 lines
1.6 KiB
Python
47 lines
1.6 KiB
Python
from collections import Counter
|
|
from deepeval.test_case import LLMTestCase
|
|
import re
|
|
from typing import Optional, Any
|
|
|
|
|
|
class F1ScoreMetric:
|
|
def __init__(self) -> None:
|
|
self.score: Optional[float] = None
|
|
self.reason: Optional[str] = None
|
|
|
|
def measure(self, test_case: "LLMTestCase") -> float:
|
|
actual = (test_case.actual_output or "").lower()
|
|
expected = (test_case.expected_output or "").lower()
|
|
|
|
actual_tokens = [
|
|
re.sub(r"\W+", "", token.strip())
|
|
for token in actual.split()
|
|
if re.sub(r"\W+", "", token.strip())
|
|
]
|
|
|
|
expected_tokens = [
|
|
re.sub(r"\W+", "", token.strip())
|
|
for token in expected.split()
|
|
if re.sub(r"\W+", "", token.strip())
|
|
]
|
|
|
|
if not actual_tokens and not expected_tokens:
|
|
self.score = 1.0
|
|
self.reason = "Both actual and expected are empty"
|
|
return self.score
|
|
|
|
actual_counts = Counter(actual_tokens)
|
|
expected_counts = Counter(expected_tokens)
|
|
|
|
tp = sum(min(actual_counts[word], expected_counts[word]) for word in actual_counts)
|
|
fp = sum(actual_counts[word] for word in actual_counts) - tp
|
|
fn = sum(expected_counts[word] for word in expected_counts) - tp
|
|
|
|
precision = tp / (tp + fp) if (tp + fp) > 0 else 0.0
|
|
recall = tp / (tp + fn) if (tp + fn) > 0 else 0.0
|
|
|
|
f1 = 2 * (precision * recall) / (precision + recall) if (precision + recall) > 0 else 0.0
|
|
self.score = f1
|
|
self.reason = f"F1: {f1:.2f} (Precision: {precision:.2f}, Recall: {recall:.2f})"
|
|
return self.score
|