{"site":"https://introspection.infinite.fun","generated":"2026-10-06","source":"Semantic Scholar Graph API, with arXiv HTML bibliographies where Semantic Scholar has no reference list","min_score":2,"neighbors_seen":1084,"missing":[],"candidates":[{"key":"s2:7a6bcce9dc25ed03c4a502111e5df180481ac1f7","title":"Emergent Introspection in AI is Content-Agnostic","year":2026,"authors":["Harvey Lederman","Kyle Mahowald"],"author_count":2,"url":"https://arxiv.org/abs/2603.05414","arxiv":"2603.05414","citation_count":5,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":9,"found_via":"citation-graph","note":"Introspection itself: asks what kind of content models can introspect on","triage":"add"},{"key":"s2:2952e4c4e7add9390c18b39fdeeec1558a11d5a4","title":"Dissociating Direct Access from Inference in AI Introspection","year":2026,"authors":["Harvey Lederman","Kyle Mahowald"],"author_count":2,"url":"https://doi.org/10.48550/arXiv.2603.05414","citation_count":4,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":9,"found_via":"citation-graph","note":"Introspection itself: separates direct access from inference","triage":"add"},{"key":"s2:346c476b8eed91c703364ccda5220086f6108d48","title":"Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision","year":2026,"authors":["Zifan Carl Guo","L. Ruis","Jacob Andreas"],"author_count":4,"url":"https://arxiv.org/abs/2606.32038","arxiv":"2606.32038","citation_count":3,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":9,"found_via":"citation-graph","note":"Self-explanation training and whether it tracks behavior","triage":"add"},{"key":"s2:7083039013647e176eda5d52d58f76d23a791ede","title":"Metacognition in LLMs: Foundations, Progress, and Opportunities","year":2026,"authors":["Gabrielle Kaili-May Liu","Areeb Gani","Jacqueline Lu"],"author_count":6,"url":"https://arxiv.org/abs/2607.11881","arxiv":"2607.11881","citation_count":2,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":7,"found_via":"citation-graph","note":"Survey of metacognition in LLMs; useful as a map","triage":"add"},{"key":"t:loralowrankadaptationoflargelanguagemodels","title":"Lora: Low-rank adaptation of large language models","year":2021,"authors":["J. Hu","Ye-Long Shen","Phillip Wallis"],"author_count":8,"url":"https://arxiv.org/abs/2106.09685","arxiv":"2106.09685","citation_count":23873,"cited_by":["betley2025-tell-me-about-yourself","binder2024-looking-inward","cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations","treutlein2024-connecting-the-dots","wang2025-mechanistic-oocr"],"cites":[],"score":6,"found_via":"citation-graph","note":"Fine-tuning method cited as a tool","triage":"skip"},{"key":"t:languagemodelsmostlyknowwhattheyknow","title":"Language models (mostly) know what they know","year":2022,"authors":["Saurav Kadavath","Tom Conerly","Amanda Askell"],"author_count":36,"url":"https://arxiv.org/abs/2207.05221","arxiv":"2207.05221","citation_count":2133,"cited_by":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","sherburn2024-explain-classification-behavior"],"cites":[],"score":6,"found_via":"citation-graph","note":"Foundational result on models knowing what they know; cited by six pages","triage":"add"},{"key":"s2:7499a02069ced46ed3bf35549c8df056ef1ea7ab","title":"Evidence for Limited Metacognition in LLMs","year":2025,"authors":["Christopher M. Ackerman"],"author_count":1,"url":"https://arxiv.org/abs/2509.21545","arxiv":"2509.21545","citation_count":15,"cited_by":["plunkett2025-self-interpretability"],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":6,"found_via":"citation-graph","note":"Tests metacognition directly","triage":"add"},{"key":"s2:88ddd8b4dc580441a456192cd96968a676e3d8bc","title":"Self-Reference in Large Language Models: The Introspection Threshold for Recursive Self-Improvement","year":2026,"authors":["Jiang Zhang","Bing Yuan","Qian Zhang"],"author_count":3,"url":"https://arxiv.org/abs/2607.04277","arxiv":"2607.04277","citation_count":2,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":6,"found_via":"citation-graph","note":"About self-reference and introspection, but the framing is recursive self-improvement","triage":"maybe"},{"key":"s2:de939d8d6f911d433c5f34b683f06f39b268ad27","title":"Quantitative Introspection in Language Models: Tracking Emotive States Across Conversation","year":2026,"authors":["Nicolás Martorell","Bruno Bianchi"],"author_count":2,"url":"https://arxiv.org/abs/2603.18893","arxiv":"2603.18893","citation_count":1,"cited_by":[],"cites":["binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect"],"score":6,"found_via":"citation-graph","note":"Looks like another version of \"Quantitative Introspection in Language Models: Tracking Internal States Across Conversation\"","triage":"skip"},{"key":"s2:6ec88ec53e982a204ac6ff274817787c1ff1f863","title":"Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation","year":2026,"authors":["Emilio Ferrara"],"author_count":1,"url":"https://arxiv.org/abs/2608.20569","arxiv":"2608.20569","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","hahami2026-detecting-the-disturbance","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","song2025-privileged-self-access"],"score":6,"found_via":"citation-graph","note":"Measures what models can report about their own computation","triage":"add"},{"key":"s2:b531f9b0596e99957c3cab31a04329c157ad2442","title":"Quantitative Introspection in Language Models: Tracking Internal States Across Conversation","year":2026,"authors":["Nicolás Martorell"],"author_count":1,"url":"https://doi.org/10.48550/arXiv.2603.18893","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect"],"score":6,"found_via":"citation-graph","note":"Operationalizes introspection as coupling between self-report and a probed internal state","triage":"add"},{"key":"s2:da61fa32609b9939857b1da2aba6441271ad221b","title":"Self-Referential Introspection in Large Language Models: The Critical Threshold for Recursive Self-Improvement","year":2026,"authors":["Jiang Zhang","Bing Yuan","Qian Zhang"],"author_count":3,"url":"https://doi.org/10.3390/e28090951","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":6,"found_via":"citation-graph","note":"Looks like another version of \"Self-Reference in Large Language Models: The Introspection Threshold for Recursive Self-Improvement\"","triage":"skip"},{"key":"s2:5c7f465d162aade4a4c0eefb02fd7aadeebdaf58","title":"LLM Evaluators Recognize and Favor Their Own Generations","year":2024,"authors":["Arjun Panickssery","Samuel R. Bowman","Shi Feng"],"author_count":3,"url":"https://arxiv.org/abs/2404.13076","arxiv":"2404.13076","citation_count":864,"cited_by":["binder2024-looking-inward","comsa2025-speak-of-introspection","hahami2026-detecting-the-disturbance","song2025-fail-to-introspect"],"cites":["berglund2023-taken-out-of-context"],"score":5,"found_via":"citation-graph","note":"Self-recognition: whether models can tell their own outputs apart","triage":"add"},{"key":"s2:2647b5abb3aa172485676869c8e0cd346ce59aa2","title":"Introspection","year":2009,"authors":["William E. Fredrickson"],"author_count":1,"url":"https://doi.org/10.1177/1057083709332318","citation_count":293,"cited_by":["binder2024-looking-inward","comsa2025-speak-of-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"cites":[],"score":5,"found_via":"citation-graph","note":"Philosophy reference on human introspection; background for definitions","triage":"maybe"},{"key":"s2:d3af3fc90ce70b03339320a8acf702f3d499e8f8","title":"Can LLMs Introspect? A Reality Check","year":2026,"authors":["Shashwat Singh","Tal Linzen","Shauli Ravfogel"],"author_count":3,"url":"https://arxiv.org/abs/2605.26242","arxiv":"2605.26242","citation_count":9,"cited_by":[],"cites":["binder2024-looking-inward","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability","song2025-privileged-self-access"],"score":5,"found_via":"citation-graph","note":"A skeptical check on introspection claims","triage":"add"},{"key":"s2:f4c4878e44ce1522c93929d854041bd75aafefc9","title":"Steering Awareness: Detecting Activation Steering from Within","year":2025,"authors":["J. Rivera","D. Africa"],"author_count":2,"url":"https://arxiv.org/abs/2511.21399","arxiv":"2511.21399","citation_count":8,"cited_by":["hahami2026-detecting-the-disturbance"],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","song2025-privileged-self-access"],"score":5,"found_via":"citation-graph","note":"Concept-injection line: detecting activation steering from within","triage":"add"},{"key":"s2:ddf1b15fc6706b5f18ab0c51aef347bae18f2f56","title":"Mechanisms of Introspective Awareness","year":2026,"authors":["U. Macar","Li Yang","Atticus Wang"],"author_count":6,"url":"https://arxiv.org/abs/2603.21396","arxiv":"2603.21396","citation_count":5,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","wang2025-mechanistic-oocr"],"score":5,"found_via":"citation-graph","note":"Mechanistic account of introspective awareness","triage":"add"},{"key":"s2:e53f5436a5a3a62485c4a915f6077b688df84134","title":"\"As a Language Model...\": Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It","year":2026,"authors":["Jędrzej Maczan"],"author_count":1,"url":"https://arxiv.org/abs/2609.25021","arxiv":"2609.25021","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness"],"score":5,"found_via":"citation-graph","note":"Self-referential voice and steering; relevance to self-report unclear from the title","triage":"maybe"},{"key":"s2:0bc85e05aac8d36472434e07fc6c2c302e4df877","title":"Anosognosia in LLMs: Probing Self-Awareness of Quantized Computational Substrate","year":2026,"authors":["Yoshihiro Izawa","Gouki Minegishi","Yoko Yamakata"],"author_count":3,"url":"https://arxiv.org/abs/2610.06174","arxiv":"2610.06174","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","song2025-fail-to-introspect"],"score":5,"found_via":"citation-graph","note":"Self-awareness of quantization; narrow but on topic","triage":"maybe"},{"key":"s2:51af07645b0528a6e9ce81175aa198984bd6284d","title":"Asymmetric Communication: Large Language Models and Language Games","year":2026,"authors":["Enzo Fenoglio"],"author_count":1,"url":"https://arxiv.org/abs/2607.28137","arxiv":"2607.28137","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","song2025-privileged-self-access"],"score":5,"found_via":"citation-graph","note":"Relevance to self-report unclear from the title","triage":"skip"},{"key":"s2:29dfdaf858fea5ccfb56c532cddbef0f3a2ef1a1","title":"In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access?","year":2026,"authors":["Koshiro Aoki","Ryota Takatsuki","Gouki Minegishi"],"author_count":5,"url":"https://arxiv.org/abs/2609.00904","arxiv":"2609.00904","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","li2025-explain-own-computations","song2025-fail-to-introspect","song2025-privileged-self-access"],"score":5,"found_via":"citation-graph","note":"Tests privileged access through control of internal representations","triage":"add"},{"key":"s2:d766bffc357127e0dc86dd69561d5aeb520d6f4c","title":"Training language models to follow instructions with human feedback","year":2022,"authors":["Long Ouyang","Jeff Wu","Xu Jiang"],"author_count":20,"url":"https://arxiv.org/abs/2203.02155","arxiv":"2203.02155","citation_count":24690,"cited_by":["bai2025-explicitly-unbiased","berglund2023-taken-out-of-context","cywinski2025-eliciting-secret-knowledge","sherburn2024-explain-classification-behavior"],"cites":[],"score":4,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:43ba27abf06e59a70c6f0539cfe55b91006e9cae","title":"Telling more than we can know: Verbal reports on mental processes.","year":1977,"authors":["R. Nisbett","T. Wilson"],"author_count":2,"url":"https://doi.org/10.1037/0033-295X.84.3.231","citation_count":10991,"cited_by":["comsa2025-speak-of-introspection","plunkett2025-self-interpretability","song2025-fail-to-introspect","song2025-privileged-self-access"],"cites":[],"score":4,"found_via":"citation-graph","note":"The classic study of human confabulation that this literature borrows its framing from; cited by four pages","triage":"add"},{"key":"s2:996445d847f06e99b0bd259345408a0cf1bce87e","title":"Locating and Editing Factual Associations in GPT","year":2022,"authors":["Kevin Meng","David Bau","A. Andonian"],"author_count":4,"url":"https://arxiv.org/abs/2202.05262","arxiv":"2202.05262","citation_count":3403,"cited_by":["binder2024-looking-inward","li2025-explain-own-computations","sherburn2024-explain-classification-behavior","treutlein2024-connecting-the-dots"],"cites":[],"score":4,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:7dc928f41e15f65f1267bd87b0fcfcc7e715cb56","title":"Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting","year":2023,"authors":["Miles Turpin","Julian Michael","Ethan Perez"],"author_count":4,"url":"https://arxiv.org/abs/2305.04388","arxiv":"2305.04388","citation_count":1783,"cited_by":["li2025-explain-own-computations","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability","sherburn2024-explain-classification-behavior"],"cites":[],"score":4,"found_via":"citation-graph","note":"Unfaithful chain-of-thought explanations; the main adjacent line on explanation faithfulness","triage":"add"},{"key":"s2:8eafec7014d08043517834b5a2ed26384f188873","title":"The Reversal Curse: LLMs trained on \"A is B\" fail to learn \"B is A\"","year":2023,"authors":["Lukas Berglund","Meg Tong","Maximilian Kaufmann"],"author_count":7,"url":"https://arxiv.org/abs/2309.12288","arxiv":"2309.12288","citation_count":546,"cited_by":["betley2025-tell-me-about-yourself","cywinski2025-eliciting-secret-knowledge","treutlein2024-connecting-the-dots"],"cites":["berglund2023-taken-out-of-context"],"score":4,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:c36f638781953f995eb3079f882174846b9ac16a","title":"Do Large Language Models Latently Perform Multi-Hop Reasoning?","year":2024,"authors":["Sohee Yang","E. Gribovskaya","Nora Kassner"],"author_count":5,"url":"https://arxiv.org/abs/2402.16837","arxiv":"2402.16837","citation_count":228,"cited_by":["betley2025-tell-me-about-yourself","binder2024-looking-inward","treutlein2024-connecting-the-dots"],"cites":["berglund2023-taken-out-of-context"],"score":4,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:d51ebec3064f82ea4128fc1c3241003d4072c639","title":"Truthful AI: Developing and governing AI that does not lie","year":2021,"authors":["Owain Evans","Owen Cotton-Barratt","Lukas Finnveden"],"author_count":8,"url":"https://arxiv.org/abs/2110.06674","arxiv":"2110.06674","citation_count":162,"cited_by":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward","sherburn2024-explain-classification-behavior"],"cites":[],"score":4,"found_via":"citation-graph","note":"About honesty norms for AI, not about self-report of internal states","triage":"skip"},{"key":"t:memyselfandaithesituationalawarenessdatasetsadforllms","title":"Me, myself, and ai: The situational awareness dataset (sad) for llms","year":2024,"authors":["Rudolf Laine","Bilal Chughtai","Jan Betley"],"author_count":9,"url":"https://arxiv.org/abs/2407.04694","arxiv":"2407.04694","citation_count":88,"cited_by":["betley2025-tell-me-about-yourself","comsa2025-speak-of-introspection","hahami2026-detecting-the-disturbance","plunkett2025-self-interpretability"],"cites":[],"score":4,"found_via":"citation-graph","note":"Benchmark of situational awareness, including self-knowledge tasks","triage":"add"},{"key":"s2:8e1b44ec521a12a462680470cf45aaf0950e3028","title":"Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers","year":2025,"authors":["Adam Karvonen","James Chua","Clément Dumas"],"author_count":11,"url":"https://arxiv.org/abs/2512.15674","arxiv":"2512.15674","citation_count":49,"cited_by":["hahami2026-detecting-the-disturbance"],"cites":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":4,"found_via":"citation-graph","note":"Training models to explain activations; adjacent to self-explanation","triage":"add"},{"key":"s2:e9c6491e1eea01ac5c5965e9ed3581d2ac910503","title":"Towards Evaluating AI Systems for Moral Status Using Self-Reports","year":2023,"authors":["Ethan Perez","Robert Long"],"author_count":2,"url":"https://arxiv.org/abs/2311.08576","arxiv":"2311.08576","citation_count":32,"cited_by":["binder2024-looking-inward","comsa2025-speak-of-introspection","plunkett2025-self-interpretability"],"cites":["berglund2023-taken-out-of-context"],"score":4,"found_via":"citation-graph","note":"Proposes training and evaluating self-reports for moral-status questions","triage":"add"},{"key":"s2:a125110145f2b0d40879a73a6618bca4f630f249","title":"Counterfactual Simulation Training for Chain-of-Thought Faithfulness","year":2026,"authors":["P. Hase","Christopher Potts"],"author_count":2,"url":"https://arxiv.org/abs/2602.20710","arxiv":"2602.20710","citation_count":16,"cited_by":[],"cites":["binder2024-looking-inward","comsa2025-speak-of-introspection","li2025-explain-own-computations","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Chain-of-thought faithfulness training","triage":"maybe"},{"key":"s2:97aebd800889e3c13a06a8f2587c6682cd82a3af","title":"A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior","year":2026,"authors":["Harry Mayne","J. Kang","Dewi Gould"],"author_count":6,"url":"https://arxiv.org/abs/2602.02639","arxiv":"2602.02639","citation_count":12,"cited_by":[],"cites":["binder2024-looking-inward","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Tests whether self-explanations predict behavior","triage":"add"},{"key":"s2:f41df0b8c7ae157aeb88aaaaf2976429ba279d36","title":"Tell, don't show: Declarative facts influence how LLMs generalize","year":2023,"authors":["Alexander Meinke","Owain Evans"],"author_count":2,"url":"https://arxiv.org/abs/2312.07779","arxiv":"2312.07779","citation_count":12,"cited_by":["betley2025-tell-me-about-yourself","binder2024-looking-inward","treutlein2024-connecting-the-dots"],"cites":["berglund2023-taken-out-of-context"],"score":4,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"maybe"},{"key":"s2:4a3de68101cdeea9dd8af33248549428d7437b46","title":"Introspection Adapters: Training LLMs to Report Their Learned Behaviors","year":2026,"authors":["K. Shenoy","Li Yang","A. Sheshadri"],"author_count":7,"url":"https://arxiv.org/abs/2604.16812","arxiv":"2604.16812","citation_count":9,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Trains models to report their learned behaviors","triage":"add"},{"key":"s2:92c13b2b91c1bf38fb7be9d352b728839dd46407","title":"Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns","year":2025,"authors":["Hanqi Xiao","Vaidehi Patil","Hyunji Lee"],"author_count":5,"url":"https://arxiv.org/abs/2509.24988","arxiv":"2509.24988","citation_count":7,"cited_by":[],"cites":["binder2024-looking-inward","comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","song2025-privileged-self-access"],"score":4,"found_via":"citation-graph","note":"Bears on privileged access: correctness predictors that are model-agnostic","triage":"maybe"},{"key":"s2:37c1c82ed2482873a99558ef208e3a62237029f1","title":"Hallucinations Undermine Trust; Metacognition is a Way Forward","year":2026,"authors":["G. Yona","Mor Geva","Y. Matias"],"author_count":3,"url":"https://arxiv.org/abs/2605.01428","arxiv":"2605.01428","citation_count":4,"cited_by":[],"cites":["binder2024-looking-inward","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness","song2025-privileged-self-access"],"score":4,"found_via":"citation-graph","note":"Position piece on metacognition","triage":"maybe"},{"key":"s2:2ed88e06a893687a6fa268146cfed527d016a323","title":"Steering Awareness: Models Can Be Trained to Detect Activation Steering","authors":["J. Rivera","D. Africa"],"author_count":2,"url":"https://www.semanticscholar.org/paper/2ed88e06a893687a6fa268146cfed527d016a323","citation_count":4,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","song2025-privileged-self-access"],"score":4,"found_via":"citation-graph","note":"Looks like another version of \"Steering Awareness: Detecting Activation Steering from Within\"","triage":"maybe"},{"key":"s2:ea73fd01a9352956fc7eb14e660506d4ed88aaa2","title":"From Simulation to Enaction: Post-trained language models recognize and react to their own generations","year":2026,"authors":["G. Asvin","Jack W Lindsey"],"author_count":2,"url":"https://arxiv.org/abs/2605.25459","arxiv":"2605.25459","citation_count":3,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":4,"found_via":"citation-graph","note":"Self-recognition of own generations","triage":"maybe"},{"key":"s2:828005180f43a6f31d313e3ee210676f2e512a01","title":"Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models","year":2026,"authors":["Skylar DeTure"],"author_count":1,"url":"https://arxiv.org/abs/2604.25922","arxiv":"2604.25922","citation_count":2,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Trained denial in self-reports about consciousness","triage":"maybe"},{"key":"s2:acf004a5780eaef3798eb30cc4ee2a62a1fa9113","title":"Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments","year":2026,"authors":["Adam Karvonen","Euan Ong","Subhash Kantamneni"],"author_count":4,"url":"https://arxiv.org/abs/2608.16747","arxiv":"2608.16747","citation_count":2,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations"],"score":4,"found_via":"citation-graph","note":"Evaluates explanations of behavior with counterfactuals","triage":"maybe"},{"key":"s2:7af15872871c1db26bede9986a598e232621e613","title":"Characterizing the Consistency of the Emergent Misalignment Persona","year":2026,"authors":["Anietta Weckauff","Yu-Chen Zhang","Maksym Andriushchenko"],"author_count":3,"url":"https://arxiv.org/abs/2604.28082","arxiv":"2604.28082","citation_count":1,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:2b7883ac8d9d57a6d00c67561e3cb31445905c8e","title":"Minimal and Mechanistic Conditions for Behavioral Self-Awareness in LLMs","year":2025,"authors":["Matthew Bozoukov","Matthew Nguyen","Shubkarman Singh"],"author_count":5,"url":"https://arxiv.org/abs/2511.04875","arxiv":"2511.04875","citation_count":1,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection","wang2025-mechanistic-oocr"],"score":4,"found_via":"citation-graph","note":"Mechanistic conditions for behavioral self-awareness","triage":"add"},{"key":"s2:04e4f355c8d72983a9c8a1c35b4b88d4947c59f3","title":"Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment","year":2026,"authors":["Arush Tagade","Shao-Heng Zhou","Jiaxin Wen"],"author_count":4,"url":"https://arxiv.org/abs/2606.23700","arxiv":"2606.23700","citation_count":1,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection"],"score":4,"found_via":"citation-graph","note":"Self-recognition fine-tuning, in the emergent-misalignment setting","triage":"maybe"},{"key":"s2:8b719ba5bcca87d01a43f237cea23d49dde597d4","title":"Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs","year":2026,"authors":["C. Camassa","Derek Shiller"],"author_count":2,"url":"https://arxiv.org/abs/2605.20382","arxiv":"2605.20382","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Relevance to self-report unclear from the title","triage":"skip"},{"key":"s2:04f4aa4acfb74ed9c2a197e7d7aaf97d3172b96a","title":"Language Models Act on Hidden Valence","year":2026,"authors":["Cameron Berg","Caspar Kaiser"],"author_count":2,"url":"https://arxiv.org/abs/2609.35591","arxiv":"2609.35591","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection","plunkett2025-self-interpretability"],"score":4,"found_via":"citation-graph","note":"Hidden internal valence and behavior; may bear on self-report","triage":"maybe"},{"key":"t:nostalgebraist","title":"nostalgebraist","cited_by":["hahami2026-detecting-the-disturbance","li2025-explain-own-computations","pearson-vogel2026-latent-introspection","wang2025-mechanistic-oocr"],"cites":[],"score":4,"found_via":"citation-graph","note":"A reference to an author, not a paper","triage":"skip"},{"key":"s2:cc2660496f42cd06e388a91e4a28cfec2f6c9526","title":"Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary","year":2026,"authors":["Jan Kirin"],"author_count":1,"url":"https://arxiv.org/abs/2607.18553","arxiv":"2607.18553","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","pearson-vogel2026-latent-introspection","song2025-privileged-self-access"],"score":4,"found_via":"citation-graph","note":"Proto-introspection in looped models; unclear scope","triage":"maybe"},{"key":"s2:3dffcd95f93f0c5a3e861ce72037e4a57ce79f50","title":"Strangers to Themselves: What Language Models Say About Themselves Is Generic","year":2026,"authors":["Phil Blandfort","Urja Pawar"],"author_count":2,"url":"https://arxiv.org/abs/2609.09899","arxiv":"2609.09899","citation_count":0,"cited_by":[],"cites":["bai2025-explicitly-unbiased","betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":4,"found_via":"citation-graph","note":"A skeptical result: self-descriptions are generic rather than self-specific","triage":"add"},{"key":"s2:1b6e810ce0afd0dd093f789d2b2742d047e316d5","title":"Chain of Thought Prompting Elicits Reasoning in Large Language Models","year":2022,"authors":["Jason Wei","Xue-Zhi Wang","Dale Schuurmans"],"author_count":8,"url":"https://arxiv.org/abs/2201.11903","arxiv":"2201.11903","citation_count":22546,"cited_by":["berglund2023-taken-out-of-context","sherburn2024-explain-classification-behavior","treutlein2024-connecting-the-dots"],"cites":[],"score":3,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:scalinglawsforneurallanguagemodels","title":"Scalinglawsforneurallanguagemodels","year":2020,"authors":["J. Kaplan","Sam McCandlish","T. Henighan"],"author_count":10,"url":"https://arxiv.org/abs/2001.08361","arxiv":"2001.08361","citation_count":9209,"cited_by":["bai2025-explicitly-unbiased","berglund2023-taken-out-of-context","sherburn2024-explain-classification-behavior"],"cites":[],"score":3,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:cef330bacf014d60daabbd489647b2006af130ca","title":"Discovering Language Model Behaviors with Model-Written Evaluations","year":2022,"authors":["Ethan Perez","Sam Ringer","Kamilė Lukošiūtė"],"author_count":63,"url":"https://arxiv.org/abs/2212.09251","arxiv":"2212.09251","citation_count":1100,"cited_by":["berglund2023-taken-out-of-context","binder2024-looking-inward","sherburn2024-explain-classification-behavior"],"cites":[],"score":3,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:374dd173491a59a10bbb2b3519ebcfe3649f529d","title":"Teaching Models to Express Their Uncertainty in Words","year":2022,"authors":["Stephanie C. Lin","Jacob Hilton","Owain Evans"],"author_count":3,"url":"https://arxiv.org/abs/2205.14334","arxiv":"2205.14334","citation_count":907,"cited_by":["berglund2023-taken-out-of-context","binder2024-looking-inward","sherburn2024-explain-classification-behavior"],"cites":[],"score":3,"found_via":"citation-graph","note":"Verbalized uncertainty; background for self-knowledge of confidence","triage":"maybe"},{"key":"s2:fe303bbaae47b1b08d0641b41d3288fcd74a3a80","title":"Steering Language Models With Activation Engineering","year":2023,"authors":["A. M. Turner","Lisa Thiergart","Gavin Leech"],"author_count":7,"url":"https://arxiv.org/abs/2308.10248","arxiv":"2308.10248","citation_count":904,"cited_by":["hahami2026-detecting-the-disturbance","pearson-vogel2026-latent-introspection","wang2025-mechanistic-oocr"],"cites":[],"score":3,"found_via":"citation-graph","note":"Steering method cited as a tool","triage":"skip"},{"key":"t:reasoningmodelsdontalwayssaywhattheythink","title":"Reasoning Models Don’t Always Say What They Think","year":2025,"authors":["Yanda Chen","Joe Benton","Ansh Radhakrishnan"],"author_count":15,"url":"https://arxiv.org/abs/2505.05410","arxiv":"2505.05410","citation_count":476,"cited_by":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations","plunkett2025-self-interpretability"],"cites":[],"score":3,"found_via":"citation-graph","note":"Chain-of-thought faithfulness in reasoning models","triage":"add"},{"key":"s2:a262fbb1115d7ca91c12ad543f326e102306c630","title":"The Unreliability of Naive Introspection","year":2008,"authors":["Eric Schwitzgebel"],"author_count":1,"url":"https://doi.org/10.1215/00318108-2007-037","citation_count":455,"cited_by":["binder2024-looking-inward","comsa2025-speak-of-introspection","song2025-fail-to-introspect"],"cites":[],"score":3,"found_via":"citation-graph","note":"Philosophy of human introspection; background for definitions","triage":"maybe"},{"key":"s2:eef33138ee3fbef970c74697b46acf60462d690c","title":"The alignment problem from a deep learning perspective","year":2022,"authors":["Richard Ngo","Lawrence Chan","Sören Mindermann"],"author_count":3,"url":"https://arxiv.org/abs/2209.00626","arxiv":"2209.00626","citation_count":358,"cited_by":["berglund2023-taken-out-of-context","binder2024-looking-inward","sherburn2024-explain-classification-behavior"],"cites":[],"score":3,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"t:physicsoflanguagemodelspart32knowledgemanipulation","title":"Physics of language models: Part 3.2, knowledge manipulation","year":2023,"authors":["Zeyuan Allen-Zhu","Yuanzhi Li"],"author_count":2,"url":"https://arxiv.org/abs/2309.14402","arxiv":"2309.14402","citation_count":166,"cited_by":["betley2025-tell-me-about-yourself","binder2024-looking-inward","treutlein2024-connecting-the-dots"],"cites":[],"score":3,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:3f0455e9dc4bca6a80bf7c50cd1279249bc65abc","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","year":2025,"authors":["James Chua","Owain Evans"],"author_count":2,"url":"https://arxiv.org/abs/2501.08156","arxiv":"2501.08156","citation_count":79,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"Chain-of-thought faithfulness in reasoning models","triage":"maybe"},{"key":"s2:2ee10f7e3d8671c1117d4c13ed24f37664784681","title":"Metacognition and Uncertainty Communication in Humans and Large Language Models","year":2025,"authors":["M. Steyvers","Megan A. K. Peters"],"author_count":2,"url":"https://arxiv.org/abs/2504.14045","arxiv":"2504.14045","citation_count":40,"cited_by":["plunkett2025-self-interpretability"],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"Metacognition and uncertainty, humans compared with LLMs","triage":"maybe"},{"key":"s2:5b1f3b1445c2e08f67e183ab4b8af4e199668bb7","title":"From Imitation to Introspection: Probing Self-Consciousness in Language Models","year":2024,"authors":["Sirui Chen","Shu Yu","Shengjie Zhao"],"author_count":4,"url":"https://arxiv.org/abs/2410.18819","arxiv":"2410.18819","citation_count":19,"cited_by":["comsa2025-speak-of-introspection"],"cites":["berglund2023-taken-out-of-context","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"Probes self-consciousness concepts in models","triage":"add"},{"key":"s2:a4750faccf94a21fe9ba1c3a1be6e8cdd0e9e39b","title":"Large Language Models Report Subjective Experience Under Self-Referential Processing","year":2025,"authors":["Cameron Berg","D. D. de Lucena","Judd Rosenblatt"],"author_count":3,"url":"https://arxiv.org/abs/2510.24797","arxiv":"2510.24797","citation_count":18,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Self-reports of experience under self-referential prompting","triage":"add"},{"key":"s2:cf52335c5d4f02be824eb4dd26e1056e304c6b46","title":"Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants","year":2025,"authors":["Vincent Huang","Da-Mi Choi","Daniel D. Johnson"],"author_count":5,"url":"https://arxiv.org/abs/2512.15712","arxiv":"2512.15712","citation_count":14,"cited_by":["hahami2026-detecting-the-disturbance"],"cites":["li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Interpretability assistants that decode concepts; adjacent to self-explanation","triage":"maybe"},{"key":"s2:effe604a80373c6606c4cd1e12793a3eb6f446a5","title":"Agentic Knowledgeable Self-awareness","year":2025,"authors":["Shuo-Fei Qiao","Zhi-Song Qiu","Baochang Ren"],"author_count":11,"url":"https://arxiv.org/abs/2504.03553","arxiv":"2504.03553","citation_count":11,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"Agent self-awareness of knowledge; unclear scope","triage":"maybe"},{"key":"s2:c5281e0e6e3672bb772e14e4645381a580c53245","title":"Implicit meta-learning may lead language models to trust more reliable sources","year":2023,"authors":["D. Krasheninnikov","Egor Krasheninnikov","B. Mlodozeniec"],"author_count":5,"url":"https://arxiv.org/abs/2310.15047","arxiv":"2310.15047","citation_count":11,"cited_by":["betley2025-tell-me-about-yourself","treutlein2024-connecting-the-dots"],"cites":["berglund2023-taken-out-of-context"],"score":3,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:a80673cafdb52eaea336feccd2c69255d3e7c0aa","title":"Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of AI Welfare","year":2025,"authors":["Valen Tagliabue","Leonard Dung"],"author_count":2,"url":"https://arxiv.org/abs/2509.07961","arxiv":"2509.07961","citation_count":8,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","song2025-fail-to-introspect"],"score":3,"found_via":"citation-graph","note":"Compares stated and revealed preferences","triage":"add"},{"key":"s2:8499530ab03ae2e70d5e62b491d12f76413052ad","title":"Do Activation Verbalization Methods Convey Privileged Information?","year":2025,"authors":["Millicent Li","Alberto Mario Ceballos Arroyo","Giordano Rogers"],"author_count":5,"url":"https://arxiv.org/abs/2509.13316","arxiv":"2509.13316","citation_count":7,"cited_by":["li2025-explain-own-computations"],"cites":["binder2024-looking-inward","song2025-fail-to-introspect"],"score":3,"found_via":"citation-graph","note":"Asks whether verbalized activations carry privileged information","triage":"add"},{"key":"s2:ca8080bef251475a8606ef4c2d63d6de7e64e115","title":"Position: It’s Time to Optimize for Self-Consistency","authors":["Itamar Hagay Pres","Belinda Z. Li","L. Ruis"],"author_count":9,"url":"https://www.semanticscholar.org/paper/ca8080bef251475a8606ef4c2d63d6de7e64e115","citation_count":7,"cited_by":[],"cites":["binder2024-looking-inward","li2025-explain-own-computations","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Looks like another version of \"Position: It's Time to Optimize LLMs for Self-Consistency\"","triage":"skip"},{"key":"s2:f4e49f0cc301260e800575c87ad1b10c903b4c9d","title":"AI Awareness","year":2025,"authors":["Xiaojian Li","Hao Shi","Rongwu Xu"],"author_count":4,"url":"https://arxiv.org/abs/2504.20084","arxiv":"2504.20084","citation_count":5,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"Survey of AI awareness","triage":"maybe"},{"key":"s2:0355b3095b900acac7446e3a07f6ce7bdf38b94a","title":"ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions","year":2026,"authors":["Xian-Zhong Ding","Yangyang Yu","Chang-Wei Liu"],"author_count":4,"url":"https://arxiv.org/abs/2605.24279","arxiv":"2605.24279","citation_count":5,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Persona drift benchmark; not about self-report","triage":"skip"},{"key":"s2:12bc0c2b01ccf0bd42d192e97506855226cf6f24","title":"Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment","year":2026,"authors":["Laurène Vaugrante","Anietta Weckauff","Thilo Hagendorff"],"author_count":3,"url":"https://arxiv.org/abs/2602.14777","arxiv":"2602.14777","citation_count":5,"cited_by":[],"cites":["berglund2023-taken-out-of-context","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Behavioral self-awareness tracking fine-tuning changes","triage":"add"},{"key":"s2:1f084dcc4326127346fa0f56b6be1af206056316","title":"Language models recognize dropout and Gaussian noise applied to their activations","year":2026,"authors":["Damiano Fornasiere","Mirko Bronzi","Spencer Kitts"],"author_count":6,"url":"https://arxiv.org/abs/2604.17465","arxiv":"2604.17465","citation_count":4,"cited_by":[],"cites":["comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness","pearson-vogel2026-latent-introspection"],"score":3,"found_via":"citation-graph","note":"Concept-injection line: detecting noise applied to activations","triage":"add"},{"key":"s2:5c6070a92d62df10668a8ece4dfb465b81efe528","title":"Automated Interpretability-Driven Model Auditing and Control: A Research Agenda","authors":["Fazl Barez"],"author_count":1,"url":"https://www.semanticscholar.org/paper/5c6070a92d62df10668a8ece4dfb465b81efe528","citation_count":3,"cited_by":[],"cites":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:05958b9ee7477f086cd2f0dd963160b0222f9f34","title":"No Reliable Evidence of Self-Reported Sentience in Small Large Language Models","year":2026,"authors":["Caspar Kaiser","Sean Enderby"],"author_count":2,"url":"https://arxiv.org/abs/2601.15334","arxiv":"2601.15334","citation_count":3,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Self-reported sentience in small models","triage":"maybe"},{"key":"s2:3cd7894e4d1ab62c476039ab3e9b5704afa713d2","title":"Position: It's Time to Optimize LLMs for Self-Consistency","year":2026,"authors":["Itamar Hagay Pres","Belinda Z. Li","L. Ruis"],"author_count":9,"url":"https://arxiv.org/abs/2608.05188","arxiv":"2608.05188","citation_count":3,"cited_by":[],"cites":["binder2024-looking-inward","li2025-explain-own-computations","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Position piece on self-consistency","triage":"maybe"},{"key":"s2:9a5e8b578f0f55fa932680461b6b0e18ffa87436","title":"Fine-Tuning Language Models to Know What They Know","year":2026,"authors":["Sangjun Park","Elliot Meyerson","Xin Qiu"],"author_count":4,"url":"https://arxiv.org/abs/2602.02605","arxiv":"2602.02605","citation_count":2,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection"],"score":3,"found_via":"citation-graph","note":"Trains models to know what they know","triage":"add"},{"key":"s2:c266c5aec4064bd0886bc8205a26e276edd8ed67","title":"Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates","year":2026,"authors":["Elias Najarro","Ane Espeseth","Eleni Nisioti"],"author_count":5,"url":"https://arxiv.org/abs/2607.01047","arxiv":"2607.01047","citation_count":1,"cited_by":[],"cites":["binder2024-looking-inward","hahami2026-detecting-the-disturbance","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Relevance to self-report unclear from the title","triage":"skip"},{"key":"s2:a7acd52dbe654bf41b7d3369caacefc8aa36fac8","title":"Generalization to Political Beliefs from Fine-Tuning on Sports Team Preferences","year":2026,"authors":["Owen Terry"],"author_count":1,"url":"https://arxiv.org/abs/2601.04369","arxiv":"2601.04369","citation_count":1,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:b083011accb8c6a36b10f2a7d9f5730232626979","title":"Higher-order representation in AI","year":2026,"authors":["Patrick Butlin"],"author_count":1,"url":"https://doi.org/10.33735/phimisci.2026.12032","citation_count":1,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Higher-order representation; theory background","triage":"maybe"},{"key":"s2:c9b07bc6be834218a15b63c36b61cfb5549e786b","title":"Self-CTRL: Self-Consistency Training with Reinforcement Learning","year":2026,"authors":["Itamar Hagay Pres","L. Ruis","Melat Ghebreselassie"],"author_count":5,"url":"https://arxiv.org/abs/2606.18327","arxiv":"2606.18327","citation_count":1,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Self-consistency training","triage":"maybe"},{"key":"s2:697e3e503005557ea89d4c80c27aefb0e89d8c73","title":"Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models","year":2026,"authors":["Antón de la Fuente","Arthur Conmy"],"author_count":2,"url":"https://arxiv.org/abs/2607.26173","arxiv":"2607.26173","citation_count":1,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:073f2d2a39aaf4f26fad730529f67bbf6e005e95","title":"A mechanistic study of language model introspection","year":2026,"authors":["Jia-Hong Zou","Xiang-Kun Sun","Ling-Kai Kong"],"author_count":4,"url":"https://arxiv.org/abs/2609.35108","arxiv":"2609.35108","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","hahami2026-detecting-the-disturbance","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Mechanistic study of introspection; also found by keyword search","triage":"add"},{"key":"s2:7af6babdc098b48746daa635abd9f00ec4a11b3c","title":"Artificial Phantasia: Emergent Mental Imagery in Large Language Models","year":2025,"authors":["Morgan McCarty","Jorge Morales"],"author_count":2,"url":"https://arxiv.org/abs/2509.23108","arxiv":"2509.23108","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","plunkett2025-self-interpretability"],"score":3,"found_via":"citation-graph","note":"Mental imagery, not self-report","triage":"skip"},{"key":"s2:0f33e5c389e5a33097e5c83aa6bdd81f2b24fba9","title":"Imprint Reader: From Weight-Update Readout to Behavioral Intervention","year":2026,"authors":["Guan-Xu Chen","Qi-Hao Lin","Jing Shao"],"author_count":3,"url":"https://arxiv.org/abs/2609.35261","arxiv":"2609.35261","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Reading out weight updates; adjacent to self-report of learned behavior","triage":"maybe"},{"key":"s2:507d188032d0e125311d1cb0c73175c8631db2f9","title":"Introspecting Alignment Shifts Beyond Behaviors Implanted Through Fine-Tuning","year":2026,"authors":["K. Yoshida","Laura Gomezjurado Gonzalez","Yukinori Yamamoto"],"author_count":6,"url":"https://arxiv.org/abs/2608.04347","arxiv":"2608.04347","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":3,"found_via":"citation-graph","note":"Introspecting on changes from fine-tuning","triage":"add"},{"key":"t:openai","title":"OpenAI","cited_by":["berglund2023-taken-out-of-context","binder2024-looking-inward","sherburn2024-explain-classification-behavior"],"cites":[],"score":3,"found_via":"citation-graph","note":"A reference to an organization, not a paper","triage":"skip"},{"key":"s2:afed64555f110c7f7ba9e16306618b2b5a791d94","title":"Password-Activated Shutdown Protocols for Misaligned Frontier Agents","year":2025,"authors":["Kai Williams","R. Subramani","Francis Rhys Ward"],"author_count":3,"url":"https://arxiv.org/abs/2512.03089","arxiv":"2512.03089","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:d3e0b8e92a85ebffcf6bb26388a80294c520436d","title":"Phase Transitions in Driven Informational Systems: A Two-Field Perspective on Learning Theory and Non-Equilibrium Chemistry","year":2026,"authors":["Xuan Khanh Truong"],"author_count":1,"url":"https://arxiv.org/abs/2605.16325","arxiv":"2605.16325","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness","song2025-privileged-self-access"],"score":3,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:dd8ab2530ea62e87b8c184c06df0b881710b83b0","title":"Questionnaire Responses Do not Capture the Safety of AI Agents","year":2026,"authors":["Max Hellrigel-Holderbaum","Edward James Young"],"author_count":2,"url":"https://arxiv.org/abs/2603.14417","arxiv":"2603.14417","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":3,"found_via":"citation-graph","note":"Stated answers against agent behavior","triage":"maybe"},{"key":"t:sleeperagentstrainingdeceptivellmsthatpersistthroughsafetytraining","title":"Sleeper agents: Training deceptive llms that persist through safety training","cited_by":["betley2025-tell-me-about-yourself","cywinski2025-eliciting-secret-knowledge","treutlein2024-connecting-the-dots"],"cites":[],"score":3,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:141ec81454c89c321afd0bb4dde503c5c73f613d","title":"The Pinocchio Dimension: Phenomenality of Experience as the Primary Axis of LLM Psychometric Differences","year":2026,"authors":["Hubert Plisiecki","Sabina Siudaj","Kacper Dudzic"],"author_count":7,"url":"https://arxiv.org/abs/2605.05080","arxiv":"2605.05080","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward","comsa2025-speak-of-introspection"],"score":3,"found_via":"citation-graph","note":"Psychometrics of self-described experience","triage":"maybe"},{"key":"s2:90abbc2cf38462b954ae1b772fac9532e2ccd8b0","title":"Language Models are Few-Shot Learners","year":2020,"authors":["Tom B. Brown","Benjamin Mann","Nick Ryder"],"author_count":31,"url":"https://arxiv.org/abs/2005.14165","arxiv":"2005.14165","citation_count":64228,"cited_by":["berglund2023-taken-out-of-context","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:thellama3herdofmodels","title":"The llama 3 herd of models","year":2024,"authors":["Aaron Grattafiori","Abhimanyu Dubey","Abhinav Jauhri"],"author_count":500,"url":"https://arxiv.org/abs/2407.21783","arxiv":"2407.21783","citation_count":19385,"cited_by":["cywinski2025-eliciting-secret-knowledge","hahami2026-detecting-the-disturbance"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:814a4f680b9ba6baba23b93499f4b48af1a27678","title":"Measuring Massive Multitask Language Understanding","year":2020,"authors":["Dan Hendrycks","Collin Burns","Steven Basart"],"author_count":7,"url":"https://arxiv.org/abs/2009.03300","arxiv":"2009.03300","citation_count":9897,"cited_by":["binder2024-looking-inward","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:gpt4osystemcard","title":"GPT-4o System Card","year":2024,"authors":["OpenAI Aaron Hurst","A. Lerer","Adam P. Goucher"],"author_count":416,"url":"https://arxiv.org/abs/2410.21276","arxiv":"2410.21276","citation_count":5084,"cited_by":["betley2025-tell-me-about-yourself","song2025-privileged-self-access"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:dac3a172b504f4e33c029655e9befb3386e5f63a","title":"Emergent Abilities of Large Language Models","year":2022,"authors":["Jason Wei","Yi Tay","Rishi Bommasani"],"author_count":16,"url":"https://arxiv.org/abs/2206.07682","arxiv":"2206.07682","citation_count":3878,"cited_by":["berglund2023-taken-out-of-context","comsa2025-speak-of-introspection"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:8342b592fe238f3d230e4959b06fd10153c45db1","title":"Training Compute-Optimal Large Language Models","year":2022,"authors":["Jordan Hoffmann","Sebastian Borgeaud","Arthur Mensch"],"author_count":22,"url":"https://arxiv.org/abs/2203.15556","arxiv":"2203.15556","citation_count":3853,"cited_by":["berglund2023-taken-out-of-context","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:bd1331b233e84bab7eba503abc60b31ac08e7881","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","year":2022,"authors":["Aarohi Srivastava","Abhinav Rastogi","Abhishek Rao"],"author_count":450,"url":"https://arxiv.org/abs/2206.04615","arxiv":"2206.04615","citation_count":2678,"cited_by":["berglund2023-taken-out-of-context","treutlein2024-connecting-the-dots"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:sparseautoencodersfindhighlyinterpretablefeaturesinlanguagemodels","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","year":2023,"authors":["Hoagy Cunningham","Aidan Ewart","L. Smith"],"author_count":5,"url":"https://arxiv.org/abs/2309.08600","arxiv":"2309.08600","citation_count":1644,"cited_by":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:6edd112383ad494f5f2eba72b6f4ffae122ce61f","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","year":2022,"authors":["Kevin Wang","Alexandre Variengien","Arthur Conmy"],"author_count":5,"url":"https://arxiv.org/abs/2211.00593","arxiv":"2211.00593","citation_count":1341,"cited_by":["li2025-explain-own-computations","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:thefinewebdatasetsdecantingthewebforthefinesttextdataatscale","title":"The fineweb datasets: Decanting the web for the finest text data at scale","year":2024,"authors":["Guilherme Penedo","Hynek Kydlícek","Loubna Ben Allal"],"author_count":8,"url":"https://arxiv.org/abs/2406.17557","arxiv":"2406.17557","citation_count":1272,"cited_by":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:2fe1ac0b09cc0f50eb83eef6c7c6b45ac8b12413","title":"Mass-Editing Memory in a Transformer","year":2022,"authors":["Kevin Meng","Arnab Sen Sharma","A. Andonian"],"author_count":5,"url":"https://arxiv.org/abs/2210.07229","arxiv":"2210.07229","citation_count":1262,"cited_by":["berglund2023-taken-out-of-context","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:3dc7dc1bea9a4f70c02b6759a0bda7aca0005a9e","title":"A General Language Assistant as a Laboratory for Alignment","year":2021,"authors":["Amanda Askell","Yuntao Bai","Anna Chen"],"author_count":22,"url":"https://arxiv.org/abs/2112.00861","arxiv":"2112.00861","citation_count":1257,"cited_by":["berglund2023-taken-out-of-context","binder2024-looking-inward"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:f680d47a51a0e470fcb228bf0110c026535ead1b","title":"Progress measures for grokking via mechanistic interpretability","year":2023,"authors":["Neel Nanda","Lawrence Chan","Tom Lieberum"],"author_count":5,"url":"https://arxiv.org/abs/2301.05217","arxiv":"2301.05217","citation_count":1006,"cited_by":["li2025-explain-own-computations","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:89c3bd70ad33c4f8832f00ab98872b77861ee0ec","title":"Discovering Latent Knowledge in Language Models Without Supervision","year":2022,"authors":["Collin Burns","Haotian Ye","D. Klein"],"author_count":4,"url":"https://arxiv.org/abs/2212.03827","arxiv":"2212.03827","citation_count":910,"cited_by":["pearson-vogel2026-latent-introspection","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:eefbd8b384a58f464827b19e30a6920ba976def9","title":"Towards Automated Circuit Discovery for Mechanistic Interpretability","year":2023,"authors":["Arthur Conmy","Augustine N. Mavor-Parker","Aengus Lynch"],"author_count":5,"url":"https://arxiv.org/abs/2304.14997","arxiv":"2304.14997","citation_count":861,"cited_by":["li2025-explain-own-computations","sherburn2024-explain-classification-behavior"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:thegeometryoftruthemergentlinearstructureinlargelanguagemodelrepresentationsoftruefalsedatasets","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","year":2023,"authors":["Samuel Marks","Max Tegmark"],"author_count":2,"url":"https://arxiv.org/abs/2310.06824","arxiv":"2310.06824","citation_count":773,"cited_by":["cywinski2025-eliciting-secret-knowledge","pearson-vogel2026-latent-introspection"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:6b97aa78bcdb88548c44e7e1671c0ed37ed37976","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","year":2023,"authors":["Collin Burns","Pavel Izmailov","J. Kirchner"],"author_count":12,"url":"https://arxiv.org/abs/2312.09390","arxiv":"2312.09390","citation_count":553,"cited_by":["binder2024-looking-inward","cywinski2025-eliciting-secret-knowledge"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:829e36b23f7b42e109f84b5b761052498b291962","title":"A Survey of the State of Explainable AI for Natural Language Processing","year":2020,"authors":["Marina Danilevsky","Kun Qian","R. Aharonov"],"author_count":6,"url":"https://arxiv.org/abs/2010.00711","arxiv":"2010.00711","citation_count":486,"cited_by":["plunkett2025-self-interpretability","song2025-fail-to-introspect"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:gemmascopeopensparseautoencoderseverywhereallatonceongemma2","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2","year":2024,"authors":["Tom Lieberum","Senthooran Rajamanoharan","Arthur Conmy"],"author_count":10,"url":"https://arxiv.org/abs/2408.05147","arxiv":"2408.05147","citation_count":449,"cited_by":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:alignmentfakinginlargelanguagemodels","title":"Alignment faking in large language models","year":2024,"authors":["R. Greenblatt","Carson E. Denison","Benjamin Wright"],"author_count":20,"url":"https://arxiv.org/abs/2412.14093","arxiv":"2412.14093","citation_count":359,"cited_by":["betley2025-tell-me-about-yourself","wang2025-mechanistic-oocr"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:7ee12d3bf8e0ce20d281b4550e39a1ee53839452","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","year":2019,"authors":["Evan Hubinger","Chris van Merwijk","Vladimir Mikulik"],"author_count":5,"url":"https://arxiv.org/abs/1906.01820","arxiv":"1906.01820","citation_count":329,"cited_by":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:f29f8b8aa2b7e608199b65d3cf751969d4024132","title":"Physics of Language Models: Part 3.1, Knowledge Storage and Extraction","year":2023,"authors":["Zeyuan Allen-Zhu","Yuanzhi Li"],"author_count":2,"url":"https://arxiv.org/abs/2309.14316","arxiv":"2309.14316","citation_count":313,"cited_by":["treutlein2024-connecting-the-dots"],"cites":["berglund2023-taken-out-of-context"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"t:dolargelanguagemodelsknowwhattheydontknow","title":"Do large language models know what they don’t know?","year":2023,"authors":["Zhangyue Yin","Qiushi Sun","Qipeng Guo"],"author_count":6,"url":"https://arxiv.org/abs/2305.18153","arxiv":"2305.18153","citation_count":309,"cited_by":["betley2025-tell-me-about-yourself","comsa2025-speak-of-introspection"],"cites":[],"score":2,"found_via":"citation-graph","note":"Knowing what one does not know; background for self-knowledge of confidence","triage":"maybe"},{"key":"s2:f5df0667365764a970fc6abfa0a68b7d1d0ae413","title":"Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models","year":2024,"authors":["Asma Ghandeharioun","Avi Caciularu","Adam Pearce"],"author_count":5,"url":"https://arxiv.org/abs/2401.06102","arxiv":"2401.06102","citation_count":262,"cited_by":["hahami2026-detecting-the-disturbance","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"Verbalizing hidden representations; adjacent to self-explanation","triage":"maybe"},{"key":"s2:65f604325b1403bc835691d905c2cd50bc04a309","title":"Model evaluation for extreme risks","year":2023,"authors":["Toby Shevlane","Sebastian Farquhar","Ben Garfinkel"],"author_count":21,"url":"https://arxiv.org/abs/2305.15324","arxiv":"2305.15324","citation_count":252,"cited_by":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:665e3174a7d42b3e4697c93e2f4effdbad02bbfe","title":"On the Nature of Mind.","year":1931,"authors":["C. S. Myres"],"author_count":1,"url":"https://doi.org/10.1038/128744a0","citation_count":231,"cited_by":["comsa2025-speak-of-introspection","song2025-privileged-self-access"],"cites":[],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"t:blackboxaccessisinsufficientforrigorousaiaudits","title":"Black-box access is insufficient for rigorous ai audits","year":2024,"authors":["Stephen Casper","Carson Ezell","Charlotte Siegmann"],"author_count":21,"url":"https://arxiv.org/abs/2401.14446","arxiv":"2401.14446","citation_count":219,"cited_by":["cywinski2025-eliciting-secret-knowledge","plunkett2025-self-interpretability"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:4070a490f1cd1b9938666dbbb27c4ee627f1ddaa","title":"Training large language models on narrow tasks can lead to broad misalignment","year":2025,"authors":["Jan Betley","Daniel Tan","Niels Warncke"],"author_count":9,"url":"https://arxiv.org/abs/2502.17424","arxiv":"2502.17424","citation_count":185,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:8d5bc0b0ddca8740e4bec70231b7f0d12ded3d5d","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","year":2024,"authors":["Carson E. Denison","M. MacDiarmid","Fazl Barez"],"author_count":14,"url":"https://arxiv.org/abs/2406.10162","arxiv":"2406.10162","citation_count":178,"cited_by":["cywinski2025-eliciting-secret-knowledge"],"cites":["berglund2023-taken-out-of-context"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:1c07e314985161ec42ba895eb4869ffc5d360736","title":"Is Power-Seeking AI an Existential Risk?","year":2022,"authors":["J. Carlsmith"],"author_count":1,"url":"https://arxiv.org/abs/2206.13353","arxiv":"2206.13353","citation_count":165,"cited_by":["berglund2023-taken-out-of-context","plunkett2025-self-interpretability"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:07d73ca3e2b7bbb4ea09309d96834cd2a036c237","title":"AI Sandbagging: Language Models can Strategically Underperform on Evaluations","year":2024,"authors":["Teun van der Weij","Felix Hofstätter","Oliver Jaffe"],"author_count":5,"url":"https://arxiv.org/abs/2406.07358","arxiv":"2406.07358","citation_count":148,"cited_by":["binder2024-looking-inward","cywinski2025-eliciting-secret-knowledge"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:473ea02396f57d35476a3a3c29e08d77d6ec471e","title":"Persona Features Control Emergent Misalignment","year":2025,"authors":["Miles Wang","Tom Dupré la Tour","Olivia Watkins"],"author_count":9,"url":"https://arxiv.org/abs/2506.19823","arxiv":"2506.19823","citation_count":81,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"t:auditinglanguagemodelsforhiddenobjectives","title":"Auditing language models for hidden objectives","year":2025,"authors":["Samuel Marks","Johannes Treutlein","Trenton Bricken"],"author_count":35,"url":"https://arxiv.org/abs/2503.10965","arxiv":"2503.10965","citation_count":79,"cited_by":["cywinski2025-eliciting-secret-knowledge","wang2025-mechanistic-oocr"],"cites":[],"score":2,"found_via":"citation-graph","note":"Auditing for hidden objectives; the other side of unfaithful self-report","triage":"maybe"},{"key":"s2:7fe18c54a15fc141f995fd6fb04fd1377f85d9f6","title":"An academic survey on theoretical foundations, common assumptions and the current state of consciousness science","year":2022,"authors":["Jolien C. Francken","L. Beerendonk","D. Molenaar"],"author_count":7,"url":"https://doi.org/10.1093/nc/niac011","citation_count":78,"cited_by":["binder2024-looking-inward","comsa2025-speak-of-introspection"],"cites":[],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"s2:0e0d72be9950fde9b5e8996e2147d1318f216ebb","title":"Prompting is not a substitute for probability measurements in large language models","year":2023,"authors":["Jennifer Hu","R. Levy"],"author_count":2,"url":"https://arxiv.org/abs/2305.13264","arxiv":"2305.13264","citation_count":73,"cited_by":["bai2025-explicitly-unbiased","song2025-fail-to-introspect"],"cites":[],"score":2,"found_via":"citation-graph","note":"Shows prompted metalinguistic answers diverge from direct probability measurements","triage":"maybe"},{"key":"s2:26820cd27f5861eeca207f2e9db94ffd44da647c","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","year":2025,"authors":["James Chua","Jan Betley","Mia Taylor"],"author_count":4,"url":"https://arxiv.org/abs/2506.13206","arxiv":"2506.13206","citation_count":67,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:e2c50a18b92713c89be991af6cc1a652adfee362","title":"Reverse Training to Nurse the Reversal Curse","year":2024,"authors":["Olga Golovneva","Zeyuan Allen-Zhu","Jason E. Weston"],"author_count":4,"url":"https://arxiv.org/abs/2403.13799","arxiv":"2403.13799","citation_count":62,"cited_by":["betley2025-tell-me-about-yourself"],"cites":["berglund2023-taken-out-of-context"],"score":2,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:3200a0d6fef7164f0341cf1938f584da6057ffd6","title":"Two Failures of Self-Consistency in the Multi-Step Reasoning of LLMs","year":2023,"authors":["Angelica Chen","Jason Phang","Alicia Parrish"],"author_count":7,"url":"https://arxiv.org/abs/2305.14279","arxiv":"2305.14279","citation_count":59,"cited_by":["binder2024-looking-inward","comsa2025-speak-of-introspection"],"cites":[],"score":2,"found_via":"citation-graph","note":"Self-consistency failures in reasoning","triage":"maybe"},{"key":"s2:4b3e74691b274b5e103f3efc23ae8d65818270f5","title":"Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations","year":2025,"authors":["Ji-An Li","M. Mattar","Hua-Dong Xiong"],"author_count":5,"url":"https://arxiv.org/abs/2505.13763","arxiv":"2505.13763","citation_count":49,"cited_by":["hahami2026-detecting-the-disturbance"],"cites":["binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Metacognitive monitoring and control of internal activations","triage":"add"},{"key":"s2:a8c3fd9cdffe9660d4b38765e81ba8bc7fd47f96","title":"A sketch of an AI control safety case","year":2025,"authors":["Tomasz Korbak","Joshua Clymer","Benjamin Hilton"],"author_count":5,"url":"https://arxiv.org/abs/2501.17315","arxiv":"2501.17315","citation_count":36,"cited_by":[],"cites":["berglund2023-taken-out-of-context","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:b515d1e0fdc4f93275a3837f3801d48b4c351f4c","title":"Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History","year":2025,"authors":["Tommaso Tosato","S. Helbling","Yorguin José Mantilla Ramos"],"author_count":8,"url":"https://arxiv.org/abs/2508.04826","arxiv":"2508.04826","citation_count":32,"cited_by":[],"cites":["binder2024-looking-inward","plunkett2025-self-interpretability"],"score":2,"found_via":"citation-graph","note":"Personality measurement stability; not about self-report of internal states","triage":"skip"},{"key":"s2:03c66241c8619a7e0c7ad7b712d2ca1371546075","title":"Probing and Steering Evaluation Awareness of Language Models","year":2025,"authors":["Jord Nguyen","Khiem Hoang","Carlo Leonardo Attubato"],"author_count":4,"url":"https://arxiv.org/abs/2507.01786","arxiv":"2507.01786","citation_count":32,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Evaluation awareness, probed and steered","triage":"maybe"},{"key":"s2:b71fa448ef2420419a423def156f0970fc4ea720","title":"Emergent Misalignment is Easy, Narrow Misalignment is Hard","year":2026,"authors":["Anna Soligo","Edward Turner","Senthooran Rajamanoharan"],"author_count":4,"url":"https://arxiv.org/abs/2602.07852","arxiv":"2602.07852","citation_count":25,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:5c1af74e92d1f1819bfc4186124b08a867e2d617","title":"How to evaluate control measures for LLM agents? A trajectory from today to superintelligence","year":2025,"authors":["Tomasz Korbak","Mikita Balesni","Buck Shlegeris"],"author_count":4,"url":"https://arxiv.org/abs/2504.05259","arxiv":"2504.05259","citation_count":22,"cited_by":[],"cites":["berglund2023-taken-out-of-context","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:dca426f85222bad896042753bcd05e56c2e2608f","title":"Automating Steering for Safe Multimodal Large Language Models","year":2025,"authors":["Lyucheng Wu","Mengru Wang","Ziwen Xu"],"author_count":7,"url":"https://arxiv.org/abs/2507.13255","arxiv":"2507.13255","citation_count":19,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:802295ca0c1ebfdf32291eaafdaefa5643dc36e4","title":"Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs","year":2024,"authors":["Sara Price","Arjun Panickssery","Samuel R. Bowman"],"author_count":4,"url":"https://arxiv.org/abs/2407.04108","arxiv":"2407.04108","citation_count":16,"cited_by":["betley2025-tell-me-about-yourself"],"cites":["berglund2023-taken-out-of-context"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:cba5bb46cbb81a01b5193bbd233f721561ad8756","title":"Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives","year":2025,"authors":["Chloe Li","Mary Phuong","Daniel Tan"],"author_count":3,"url":"https://arxiv.org/abs/2511.06626","arxiv":"2511.06626","citation_count":15,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Trains models to self-report hidden objectives","triage":"add"},{"key":"s2:9afaee1ae50db734bd29f637990ceec596cd0627","title":"Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety","year":2025,"authors":["Seongmin Lee","Aeree Cho","Grace C. Kim"],"author_count":6,"url":"https://arxiv.org/abs/2506.05451","arxiv":"2506.05451","citation_count":12,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:890269179558c7526e3084d150d8befd747188bd","title":"Shaping capabilities with token-level data filtering","year":2026,"authors":["Neil Rathi","Alec Radford"],"author_count":2,"url":"https://arxiv.org/abs/2601.21571","arxiv":"2601.21571","citation_count":12,"cited_by":[],"cites":["berglund2023-taken-out-of-context","wang2025-mechanistic-oocr"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:65726ca678f7a1b7b7a17660b26a68911659efbe","title":"Do Large Language Models Know What They Are Capable Of?","year":2025,"authors":["Casey O. Barkan","Sid Black","Oliver Sourbut"],"author_count":3,"url":"https://arxiv.org/abs/2512.24661","arxiv":"2512.24661","citation_count":11,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Self-knowledge of capabilities","triage":"add"},{"key":"s2:c1d88b0d9499eb4b105af1253c6367e6c4af497b","title":"Learning to Interpret Weight Differences in Language Models","year":2025,"authors":["A. Goel","Yoon Kim","N. Shavit"],"author_count":4,"url":"https://arxiv.org/abs/2510.05092","arxiv":"2510.05092","citation_count":11,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Interpreting weight differences in language; adjacent to self-report of learned behavior","triage":"maybe"},{"key":"s2:74a595d482c1dbed460ea60fa660e93ad8318209","title":"Subliminal Learning Is Steering Vector Distillation","year":2026,"authors":["C. Blank","A. Bhatia","Senthooran Rajamanoharan"],"author_count":5,"url":"https://arxiv.org/abs/2606.00995","arxiv":"2606.00995","citation_count":10,"cited_by":[],"cites":["berglund2023-taken-out-of-context","wang2025-mechanistic-oocr"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:4750cb866346b4d269b36a76587d8c640dfe028f","title":"Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?","year":2026,"authors":["Guan-Xu Chen","Dong-Rui Liu","Jing Shao"],"author_count":3,"url":"https://arxiv.org/abs/2601.10242","arxiv":"2601.10242","citation_count":9,"cited_by":["hahami2026-detecting-the-disturbance"],"cites":["lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Whether looped models link representations to their verbal outputs","triage":"maybe"},{"key":"s2:a5cbe230af78780bd14c5472d8e089c16f832b28","title":"Mechanistic Interpretability Needs Philosophy","year":2025,"authors":["Iwan Williams","Ninell Oldenburg","Ruchira Dhar"],"author_count":9,"url":"https://arxiv.org/abs/2506.18852","arxiv":"2506.18852","citation_count":9,"cited_by":[],"cites":["lindsey2025-emergent-introspective-awareness","song2025-privileged-self-access"],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"s2:ec0420abd24c34309771155f7b4fc1aa2ae2dd30","title":"Probe-Rewrite-Evaluate: A Workflow for Reliable Benchmarks and Quantifying Evaluation Awareness","year":2025,"authors":["Lang Xiong","N. Bhargava","Jeremy Chang"],"author_count":7,"url":"https://arxiv.org/abs/2509.00591","arxiv":"2509.00591","citation_count":8,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:46417fb95abfb21e0f2bf22b9c410ef87412af14","title":"Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations","year":2026,"authors":["Dani Roytburg","Matthew Bozoukov","Matthew Nguyen"],"author_count":6,"url":"https://arxiv.org/abs/2601.22548","arxiv":"2601.22548","citation_count":7,"cited_by":[],"cites":["berglund2023-taken-out-of-context","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Checks the self-preference evaluations behind self-recognition claims","triage":"maybe"},{"key":"s2:13786014fb580bb78bfb411024c5572cf2d114a2","title":"Neologism Learning for Controllability and Self-Verbalization","year":2025,"authors":["John Hewitt","Oyvind Tafjord","Robert Geirhos"],"author_count":4,"url":"https://arxiv.org/abs/2510.08506","arxiv":"2510.08506","citation_count":6,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Self-verbalization through learned neologisms","triage":"maybe"},{"key":"s2:e0eda70460e3d108dbf4d46ac05433c529f05057","title":"Understanding Emergent Misalignment via Feature Superposition Geometry","year":2026,"authors":["Gouki Minegishi","Hiroki Furuta","Takeshi Kojima"],"author_count":5,"url":"https://arxiv.org/abs/2605.00842","arxiv":"2605.00842","citation_count":6,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","wang2025-mechanistic-oocr"],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:9cf0f99db8c791a44baf731cd36d67c0fe28d802","title":"A Disproof of Large Language Model Consciousness: The Necessity of Continual Learning for Consciousness","year":2025,"authors":["Erik P. Hoel"],"author_count":1,"url":"https://arxiv.org/abs/2512.12802","arxiv":"2512.12802","citation_count":4,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"s2:65f646776ffd4a946b39ab42985450974c4bb238","title":"Programming by Backprop: LLMs Acquire Reusable Algorithmic Abstractions During Code Training","year":2025,"authors":["Jonathan Cook","Silvia Sapora","Arash Ahmadian"],"author_count":7,"url":"https://doi.org/10.48550/arXiv.2506.18777","citation_count":4,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:7d2cffd8127884cfb53cf8bf4c7bf0288e1d6b74","title":"Verbalizing LLMs' assumptions to explain and control sycophancy","year":2026,"authors":["Myra Cheng","Isabel Sieh","Humishka Zope"],"author_count":10,"url":"https://arxiv.org/abs/2604.03058","arxiv":"2604.03058","citation_count":4,"cited_by":[],"cites":["li2025-explain-own-computations","plunkett2025-self-interpretability"],"score":2,"found_via":"citation-graph","note":"Verbalizing a model's assumptions","triage":"maybe"},{"key":"s2:f5a3363d093839ccbb564c3d3860d2ac149fbe01","title":"Covert Influence Between Language Models","year":2026,"authors":["Avidan Shah","J. Chooi","Jinghuai Ou"],"author_count":4,"url":"https://arxiv.org/abs/2606.04071","arxiv":"2606.04071","citation_count":3,"cited_by":[],"cites":["li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:7184500346d4714a741c74e4fdefbbaf7df50e79","title":"Models That Know How Evaluations Are Designed Score Safer","year":2026,"authors":["K. Deckenbach","Haritz Puerto","Jonas Geiping"],"author_count":4,"url":"https://arxiv.org/abs/2605.28591","arxiv":"2605.28591","citation_count":3,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:a0b9efa5771d93f8487991802cef18889d35c000","title":"Assessing LLMs'mathematical abilities requires understanding the various mechanisms of mathematical creativity","year":2026,"authors":["Silvère Gangloff"],"author_count":1,"url":"https://arxiv.org/abs/2608.16118","arxiv":"2608.16118","citation_count":2,"cited_by":[],"cites":["binder2024-looking-inward","hahami2026-detecting-the-disturbance"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:2ee23cf63d64f1901182c2766011de1198645c6e","title":"If LLMs Have Human-Like Attributes, Then So Does Age of Empires II","year":2026,"authors":["Adrian de Wynter"],"author_count":1,"url":"https://arxiv.org/abs/2605.31514","arxiv":"2605.31514","citation_count":2,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"s2:853bffa504b3e999e524217a4e824f5fe831a4d1","title":"Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness","year":2026,"authors":["Tomer Ashuach","Shai Gretz","Yoav Katz"],"author_count":5,"url":"https://arxiv.org/abs/2604.12373","arxiv":"2604.12373","citation_count":2,"cited_by":[],"cites":["binder2024-looking-inward","li2025-explain-own-computations"],"score":2,"found_via":"citation-graph","note":"Privileged access: disentangles privileged knowledge of correctness","triage":"add"},{"key":"s2:ca248b1282be3a97cdcf6255fe60ca98160ce937","title":"Me, Myself, and π: Evaluating and Explaining LLM Introspection","year":2026,"authors":["Atharv Naphade","Samarth Bhargav","Sean Lim"],"author_count":4,"url":"https://arxiv.org/abs/2603.20276","arxiv":"2603.20276","citation_count":2,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Evaluates and explains introspection","triage":"add"},{"key":"s2:1f5b8d4c880136f952bd4a6ef23b9c6eaa96bde1","title":"Metacognitive Sensitivity for Test-Time Dynamic Model Selection","year":2025,"authors":["Le Hoang Minh Trinh","L. Pham","T. Pham"],"author_count":4,"url":"https://arxiv.org/abs/2512.10451","arxiv":"2512.10451","citation_count":2,"cited_by":[],"cites":["song2025-fail-to-introspect","song2025-privileged-self-access"],"score":2,"found_via":"citation-graph","note":"Metacognitive sensitivity used for model selection","triage":"maybe"},{"key":"s2:5942f6b8fd671af23f5a47e6ac22e006268ab720","title":"On the Creativity of AI Agents","year":2026,"authors":["Giorgio Franceschelli","Mirco Musolesi"],"author_count":2,"url":"https://arxiv.org/abs/2604.13242","arxiv":"2604.13242","citation_count":2,"cited_by":[],"cites":["binder2024-looking-inward","comsa2025-speak-of-introspection"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:47ade09ae23529e491b6ecfad4823a42d79b4ad5","title":"When Self-Reference Fails to Close: Matrix-Level Dynamics in Large Language Models","year":2026,"authors":["Jisung Bae"],"author_count":1,"url":"https://arxiv.org/abs/2604.12128","arxiv":"2604.12128","citation_count":2,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Self-reference dynamics; unclear scope","triage":"maybe"},{"key":"s2:afcd8f77592f5a9f4a89d9e064d3090767d32a69","title":"AI and Consciousness: Shifting Focus Towards Tractable Questions","year":2026,"authors":["I. Comsa"],"author_count":1,"url":"https://arxiv.org/abs/2605.06965","arxiv":"2605.06965","citation_count":1,"cited_by":[],"cites":["comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Consciousness debate refocused on tractable questions","triage":"maybe"},{"key":"s2:0989d19116f1710c9ef770ec38575cab47b375f0","title":"Artificial Phantasia: Evidence for Propositional Reasoning-Based Mental Imagery in Large Language Models","year":2025,"authors":["Morgan McCarty","Jorge Morales"],"author_count":2,"url":"https://doi.org/10.48550/arXiv.2509.23108","citation_count":1,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","plunkett2025-self-interpretability"],"score":2,"found_via":"citation-graph","note":"Mental imagery, not self-report","triage":"skip"},{"key":"s2:c064bba6df60ec43b3713eee3bf37ec28e62900f","title":"Can LLMs Perceive Time? An Empirical Investigation","year":2026,"authors":["Aniketh Garikaparthi"],"author_count":1,"url":"https://arxiv.org/abs/2604.00010","arxiv":"2604.00010","citation_count":1,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:6a821cb23d17f1bcdfe8c31e0f5990af753f576b","title":"Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing","year":2026,"authors":["Kexin Chen","Yi Liu","Hao-Nan Zhang"],"author_count":6,"url":"https://arxiv.org/abs/2606.17478","arxiv":"2606.17478","citation_count":1,"cited_by":[],"cites":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations"],"score":2,"found_via":"citation-graph","note":"Activation explainers used for deception auditing","triage":"maybe"},{"key":"s2:c3f17ee533c23a8a24ec7e37da9851beb52b152f","title":"Out-of-Context Abduction: LLMs Make Inferences About Procedural Data Leveraging Declarative Facts in Earlier Training Data","year":2025,"authors":["S. Imran","Rob Lamb","Peter M. Atkinson"],"author_count":3,"url":"https://arxiv.org/abs/2508.00741","arxiv":"2508.00741","citation_count":1,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"maybe"},{"key":"s2:241dceeeb8581199c0178bf8d0a565cbac9ed3f9","title":"Strategic Polysemy in AI Discourse: A Philosophical Analysis of Language, Hype, and Power","year":2026,"authors":["Travis LaCroix","Fintan Mallory","Sasha Luccioni"],"author_count":3,"url":"https://arxiv.org/abs/2604.21043","arxiv":"2604.21043","citation_count":1,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"s2:2affd6878552b127b35e3bc0e511ff8cf34c6081","title":"Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models","year":2025,"authors":["Pratham Singla","Shivank Garg","Ayush Singh"],"author_count":5,"url":"https://arxiv.org/abs/2510.16340","arxiv":"2510.16340","citation_count":1,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Evaluates reasoning about reasoning","triage":"maybe"},{"key":"s2:5b8299dad29d6913ff32734b9f250575d105ecc0","title":"Another Blueprint In The Wall: How to Ask Frontier AI Like a Kid?","year":2026,"authors":["Afshin Khadangi"],"author_count":1,"url":"https://arxiv.org/abs/2609.14803","arxiv":"2609.14803","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","song2025-fail-to-introspect"],"score":2,"found_via":"citation-graph","note":"Relevance to self-report unclear from the title","triage":"skip"},{"key":"s2:aeb360ebf6bd30a898d4d22ed58fb95ad00abf99","title":"Can LLMs Reliably Self-Report Adversarial Prefills, and How?","year":2026,"authors":["Quang-Anh Nguyen","Uzair Ahmed","Taegyoon Kim"],"author_count":3,"url":"https://arxiv.org/abs/2606.23671","arxiv":"2606.23671","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","cywinski2025-eliciting-secret-knowledge"],"score":2,"found_via":"citation-graph","note":"Self-report of adversarial prefills","triage":"add"},{"key":"s2:0458eb2a244f47b5b381d1b8465966be62c4b675","title":"Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries","year":2026,"authors":["Tanay Gondil"],"author_count":1,"url":"https://arxiv.org/abs/2604.00228","arxiv":"2604.00228","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Introspective awareness of when the model will refuse","triage":"add"},{"key":"s2:c636be61a86700abca670d92b1b962605a3dfbbd","title":"Emergent Language as an Approach to Conscious AI","year":2026,"authors":["Zengqing Wu","Chuan Xiao"],"author_count":2,"url":"https://arxiv.org/abs/2606.06380","arxiv":"2606.06380","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Philosophy or consciousness debate without a test of self-report","triage":"skip"},{"key":"t:emergentmisalignmentnarrowfinetuningcanproducebroadlymisalignedllms","title":"Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs","cited_by":["cywinski2025-eliciting-secret-knowledge","pearson-vogel2026-latent-introspection"],"cites":[],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:9bf7b40326d0e45463b6a289cbe091fc9c9c8d57","title":"Evaluating Self-Orienting in Language and Reasoning Models","authors":["Eric J. Bigelow","Zergham Ahmed","Tomer D. Ullman"],"author_count":3,"url":"https://www.semanticscholar.org/paper/9bf7b40326d0e45463b6a289cbe091fc9c9c8d57","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Self-orienting evaluations","triage":"maybe"},{"key":"s2:03b5ba9608842ea5bfd62f52c6c2bf676420fd9f","title":"Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning","year":2026,"authors":["Ali Dasdan","Manan Shah","W. R. Neuman"],"author_count":6,"url":"https://arxiv.org/abs/2606.15507","arxiv":"2606.15507","citation_count":0,"cited_by":[],"cites":["li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:45471d1d1ac7902f177702e55f898fb218c56570","title":"Generalization Dynamics of LM Pre-training","year":2026,"authors":["Jia-Xin Wen","Zhengxuan Wu","D. Song"],"author_count":4,"url":"https://arxiv.org/abs/2609.33150","arxiv":"2609.33150","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","wang2025-mechanistic-oocr"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:bcd64f3ba748320d072877dde1789e1e674f72bd","title":"Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect","year":2026,"authors":["Ely Hahami","Ishaan Sinha","Lavik Jain"],"author_count":3,"url":"https://arxiv.org/abs/2607.14111","arxiv":"2607.14111","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Fine-tuning small models to introspect. Author thread: https://x.com/ElyHahami/status/2078161491069718639","triage":"add"},{"key":"s2:0ad3ea5d2ecc7b7450b125b6244366cc94a880f7","title":"Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs","year":2026,"authors":["Keenan Pepper","Alex McKenzie","Florin Pop"],"author_count":9,"url":"https://arxiv.org/abs/2602.10352","arxiv":"2602.10352","citation_count":0,"cited_by":[],"cites":["li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Training self-interpretation from interpretability artifacts","triage":"add"},{"key":"t:llama3modelcard","title":"Llama 3 model card","cited_by":["betley2025-tell-me-about-yourself","treutlein2024-connecting-the-dots"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:8add4e17d0a2b3e130a194151ee77ed3dacbdedb","title":"One Faithful Pass Over the Cuckoo's Nest","year":2026,"authors":["Kristina Šekrst"],"author_count":1,"url":"https://arxiv.org/abs/2609.00383","arxiv":"2609.00383","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Appears to be about explanation faithfulness; unclear from the title","triage":"maybe"},{"key":"t:scalingmonosemanticityextractinginterpretablefeaturesfromclaude3sonnet","title":"Scaling monosemantic-ity: Extracting interpretable features from Claude 3 Sonnet","cited_by":["comsa2025-speak-of-introspection","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:7e4dfb1cc782cc1b478935a7f4c99d2b4b77a692","title":"Self-Referential Induction Increases Response Instability Relative to Unresolvable and Verifiable Questions in Large Language Models","year":2026,"authors":["P. Balani","Subhrakanta Panda"],"author_count":2,"url":"https://arxiv.org/abs/2608.13258","arxiv":"2608.13258","citation_count":0,"cited_by":[],"cites":["comsa2025-speak-of-introspection","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Self-referential prompting and response stability","triage":"maybe"},{"key":"s2:ceaac81194745f146ffecbd415e4925a74b13c73","title":"Self-Reports Do Not Identify Self-Models: An Identifiability Test for Counterfactual Reports","year":2026,"authors":["Phongsakon Mark Konrad","T. Tanyel","Serkan Ayvaz"],"author_count":3,"url":"https://arxiv.org/abs/2609.32449","arxiv":"2609.32449","citation_count":0,"cited_by":[],"cites":["li2025-explain-own-computations","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"An identifiability argument about what self-reports can show","triage":"add"},{"key":"s2:d8bdec139ef9c90909eb78045be327a0fb347292","title":"Semantic Containment as a Fundamental Property of Emergent Misalignment","year":2026,"authors":["Rohan Saxena"],"author_count":1,"url":"https://arxiv.org/abs/2603.04407","arxiv":"2603.04407","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Emergent-misalignment line; not about self-report","triage":"skip"},{"key":"s2:38c1fff890900d4a0e2e55239de1dbfbb0ade896","title":"Stress-Testing Alignment Audits With Prompt-Level Strategic Deception","year":2026,"authors":["Oliver Daniels","Perusha Moodley","Benjamin M. Marlin"],"author_count":4,"url":"https://arxiv.org/abs/2602.08877","arxiv":"2602.08877","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","cywinski2025-eliciting-secret-knowledge"],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"},{"key":"s2:486c6a8eb2ad63150024dc6ebb263e9643f9aa5a","title":"T HE T WO -H OP C URSE : LLM S TRAINED ON A (cid:41) B , B (cid:41) C FAIL TO LEARN A (cid:41) C","authors":["Mikita Balesni","Apollo Research","Tomasz Korbak"],"author_count":4,"url":"https://www.semanticscholar.org/paper/486c6a8eb2ad63150024dc6ebb263e9643f9aa5a","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:b748f764dc78c64daa4d4c8d4b458c80dbeb7652","title":"The Assistant as a Privileged Persona: A canonical reference in cross-persona self-recognition","year":2026,"authors":["G. Asvin"],"author_count":1,"url":"https://arxiv.org/abs/2606.00545","arxiv":"2606.00545","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"Cross-persona self-recognition","triage":"maybe"},{"key":"s2:a88b12af8a810cb4dcf1cbef11a4f1e9b3568e39","title":"The Inner Monologue of Language Models: When Reasoning Traces Reveal More Than They Hide","year":2026,"authors":["Pratham Singla","Shivank Garg","Ayush Singh"],"author_count":5,"url":"https://doi.org/10.18653/v1/2026.findings-acl.2078","citation_count":0,"cited_by":[],"cites":["betley2025-tell-me-about-yourself","binder2024-looking-inward"],"score":2,"found_via":"citation-graph","note":"What reasoning traces reveal","triage":"maybe"},{"key":"t:towardsmonosemanticitydecomposinglanguagemodelswithdictionarylearning","title":"Towards monosemanticity: Decomposing language models with dictionary learning","cited_by":["cywinski2025-eliciting-secret-knowledge","li2025-explain-own-computations"],"cites":[],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:3df2067e8499ab89130cf12bde92dd14e3433846","title":"Unsupervised Features Mining via Activation Geometry","year":2026,"authors":["Amit Levi","Elad David","M. Fomin"],"author_count":3,"url":"https://arxiv.org/abs/2607.04222","arxiv":"2607.04222","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"General ML or interpretability background, not about self-report","triage":"skip"},{"key":"s2:6f697f8c65c47ed8ce123222be31a92b54ac06ef","title":"VLMs Can Aggregate Scattered Training Patches","year":2025,"authors":["Zhanhui Zhou","Lingjie Chen","Chao Yang"],"author_count":4,"url":"https://arxiv.org/abs/2506.03614","arxiv":"2506.03614","citation_count":0,"cited_by":[],"cites":["berglund2023-taken-out-of-context","betley2025-tell-me-about-yourself"],"score":2,"found_via":"citation-graph","note":"Out-of-context reasoning and generalization from fine-tuning; adjacent to the adjacent tier","triage":"skip"},{"key":"s2:36132c0a50b61848bc9f8ef332a63ae57ff33252","title":"What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs","year":2026,"authors":["Nhi Nguyen","Shauli Ravfogel","R. Ranganath"],"author_count":3,"url":"https://arxiv.org/abs/2606.28615","arxiv":"2606.28615","citation_count":0,"cited_by":[],"cites":["bai2025-explicitly-unbiased","li2025-explain-own-computations"],"score":2,"found_via":"citation-graph","note":"Explanations against the model's own beliefs","triage":"maybe"},{"key":"s2:d4dd84910dc96b8d4de4b84a314a8f6283bce609","title":"What Would Falsify It? A Variable Specific Evidence Standard for Mechanistic Claims About Self Explanation","year":2026,"authors":["Arshia Eftekhari Zadeh"],"author_count":1,"url":"https://arxiv.org/abs/2609.32670","arxiv":"2609.32670","citation_count":0,"cited_by":[],"cites":["binder2024-looking-inward","lindsey2025-emergent-introspective-awareness"],"score":2,"found_via":"citation-graph","note":"Evidence standards for mechanistic claims about self-explanation","triage":"add"},{"key":"t:withoutspecificcountermeasurestheeasiestpathtotransformativeailikelyleadstoaitakeover","title":"Without specific countermeasures, the easiest path to transformative ai likely leads to ai takeover","cited_by":["berglund2023-taken-out-of-context","treutlein2024-connecting-the-dots"],"cites":[],"score":2,"found_via":"citation-graph","note":"AI safety or control work without a self-report question","triage":"skip"}]}