LLMs1 min read
SWORD Benchmark Reveals LLM Factual Error Weaknesses Across Languages
The SWORD benchmark identifies inconsistencies in LLM factual error rejection by evaluating syntactically correct, but factually incorrect, statements across multiple languages. Results show models prioritize distributional familiarity over genuine verification and exhibit significant performance drops in East Asian languages.
From arXiv cs.CL