Auditable and Robust LLM-Based Phishing Detection via Provenance-Guided Evidence Contracts
Yue Xu1, Xiong Luo2,*
1 Computer Science, Northeastern University, Vancouver, BC, Canada
2 Department of Information Technology, Uppsala University, Uppsala, Sweden
* Corresponding Author: Xiong Luo. Email:
(This article belongs to the Special Issue: Advances in Cybersecurity for Digital Ecosystems)
Computers, Materials & Continua https://doi.org/10.32604/cmc.2026.085276
Received 08 May 2026; Accepted 28 July 2026; Published online 20 September 2026
Abstract
Large language model (LLM)-based phishing detectors can produce decisions and explanations, but adversarial webpages violate the assumption that all input text is trustworthy evidence. Hidden comments, metadata, scripts, Cascading Style Sheets (CSS), and retrieved snippets can act as instruction-injection channels, while free-form rationales are hard to audit mechanically. We argue that robust LLM phishing detection should separate interface-attributed invariance from learned adversarial robustness. We introduce an evidence contract that binds model conditioning, output provenance, and deterministic validation to the same admissible evidence scope. A deterministic extractor exposes rendered-visible text, interaction-relevant artifacts, and Uniform Resource Locator (URL) tokens when available, while excluding non-admissible channels. The model emits atomic findings: fixed-schema intent–artifact records with mandatory provenance pointers. Validators check schema, provenance admissibility, value–span matching, and phishing-specific intent–artifact consistency. The formal claim is narrow: a predictor that conditions only on serialized admissible evidence is invariant to transformations that preserve that evidence. Learning is used for the non-guaranteed regime. We propose Intent–Artifact Constrained Regularized Learning (IACRL), which penalizes validator violations and paired-output instability under admissible perturbations. A four-corpus protocol separates interface-attributed invariance from learned empirical stability. Across four corpora, IACRL changes clean area under the receiver operating characteristic curve (AUROC) by
0.004 to +0.006 while improving validator pass rates by 0.096–0.181, intent–artifact consistency by 0.073–0.151, and empirical finding stability.
Keywords
Phishing detection; large language models; evidence contract; atomic findings; provenance; deterministic auditing; instruction injection; adversarial robustness; intent–artifact consistency