
@Article{cmc.2026.085276,
AUTHOR = {Yue Xu, Xiong Luo},
TITLE = {Auditable and Robust LLM-Based Phishing Detection via Provenance-Guided Evidence Contracts},
JOURNAL = {Computers, Materials \& Continua},
VOLUME = {},
YEAR = {},
NUMBER = {},
PAGES = {{pages}},
URL = {http://www.techscience.com/cmc/online/detail/28363},
ISSN = {1546-2226},
ABSTRACT = {Large language model (LLM)-based phishing detectors can produce decisions and explanations, but adversarial webpages violate the assumption that all input text is trustworthy evidence. Hidden comments, metadata, scripts, Cascading Style Sheets (CSS), and retrieved snippets can act as instruction-injection channels, while free-form rationales are hard to audit mechanically. We argue that robust LLM phishing detection should separate interface-attributed invariance from learned adversarial robustness. We introduce an evidence contract that binds model conditioning, output provenance, and deterministic validation to the same admissible evidence scope. A deterministic extractor exposes rendered-visible text, interaction-relevant artifacts, and Uniform Resource Locator (URL) tokens when available, while excluding non-admissible channels. The model emits atomic findings: fixed-schema intent–artifact records with mandatory provenance pointers. Validators check schema, provenance admissibility, value–span matching, and phishing-specific intent–artifact consistency. The formal claim is narrow: a predictor that conditions only on serialized admissible evidence is invariant to transformations that preserve that evidence. Learning is used for the non-guaranteed regime. We propose Intent–Artifact Constrained Regularized Learning (IACRL), which penalizes validator violations and paired-output instability under admissible perturbations. A four-corpus protocol separates interface-attributed invariance from learned empirical stability. Across four corpora, IACRL changes clean area under the receiver operating characteristic curve (AUROC) by <math id="mml-ieqn-1"><mo>−</mo></math>0.004 to +0.006 while improving validator pass rates by 0.096–0.181, intent–artifact consistency by 0.073–0.151, and empirical finding stability.},
DOI = {10.32604/cmc.2026.085276}
}



