Architectural Safety Boundaries in Consumer-Facing Large Language Models: A Multilateral Model-as-a-Judge Evaluation Framework
At a glance
- Citations
- 0
- References
- 0
- Comments
- 0
Abstract
As consumer interfaces accelerate the integration of large language model (LLM) architectures, validating outputs presents a critical software engineering bottleneck. While traditional software verification relies on deterministic scripts executing predictable "pass/fail" assertions, generative model behaviors are inherently non-deterministic, introducing semantic hallucinations and policy deviations. This paper introduces a novel, scalable architectural framework utilizing an asynchronous, multi-model evaluation strategy. By employing highly specialized secondary LLM instances as objective algorithmic judges, this architecture automates continuous validation across four key alignment axes: Content Quality, Semantic Safety, System Policy Compliance, and Neutral Point of View (NPOV).
Publication details
- DOI
- 10.5281/zenodo.20823994
- OpenAlex
- W7165803101
- Document type
- preprint
- Language
- EN
- Source
- Zenodo (CERN European Organization for Nuclear Research)
- Last metadata update
Comments
Log in to join the discussion.