Research Brief
Key Takeaways
- • Key findings from research papers
Sources
- Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals
- From Frame-Level Recognition to Event-Level Confirmation: Repair Traces and Runtime Failure Analysis of Public-Space Gesture Interaction
- AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems
- Procedural Knowledge Is Not Low-Rank: Why LoRA Fails to Internalize Multi-Step Procedures
- Lost in Context: Addressing Context Anxiety in Large Language Models
- From Profiles to Steering Vectors: Global Sparse Priors and Local Semantic Calibration for Personalized Text Generation
- Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems
- Trajectory-Aware Retrieval Agents for Temporal Decision- Making
- From Seasonality to Semantics: Benchmarking a Hybrid Probabilistic Forecasting System for Roadblocks in Bolivia
- DAGForge: Auditable Causal DAG Authoring with Biomedical Literature
- Semiotic logical hexagon theory for LLM logical reasoning
- Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
- Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents
- Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model
- Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
- Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration
- Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control
- FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs
- LeafData: An Agentic System for Data Migration
- Concept-based Visual Counterfactual Explanations with Diffusion Models
- SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series
- QFoldAgent: An Autonomous Quantum Optimization Multi-Agent System for Protein Structure Prediction
- Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
- DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs
- MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models
- Codifying the Judge: Scalable Evaluation via Program Distillation
- SF-AMS: Strategic Forgetting for Structured Memory in LLM Agent
- Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents
- Loss-Aware Feature-Map Pruning in Convolutional Neural Networks Using Multi-Armed Bandits
- DSTFView: Multi-View Cloud-Edge Workload Forecasting with Dual-Input Spatio-Temporal-Frequency Modeling
- MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models
- Keyword Matters: Unveiling the Energy Sensitivity of On-Device LLM Prompting
- Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines
- Reference Feature Atlases for Mechanistic Auditing of Language Models
- SCAIR: Schema-Conditioned Agentic Iterative Reasoning for Enterprise Knowledge Graphs
- Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL
- PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability
- Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning
- Temporal Context Reinstatement Drives Episodic-Like Order Memory in Long-Context Language Models
- cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs
- HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
- ARdena: Scenario-driven control of real-time LLM agents
- KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering
- Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation
- MINT-V2X: A Mobility-Integrated Network Trajectory Dataset for Predictive Resource Management
- EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation
- StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech
- TRE: Training-Free Hallucination Detection for Diffusion Language Models
- CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
- Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models
- Obliviate: Efficient Unlearning in Recommender Systems
- Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance
- AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- DOSA: A Tree-Guided, Self-Regressive Framework for Long Document Structure Analysis
- A Vocabulary for Multi-Agent Automated Research Systems
- Imprompt: A Language Framework for Prompt Programming
- Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents
- Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents
- LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory
- HiLLTS: Zero-Shot Hierarchical LLM-Guided Traffic Signal Control for Sustainable Transportation
- Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture
- Bayesian Repetition Penalty: A Principled Adjacent-Conditional Framework for Reversing Attention Collapse in Autoregressive Language Models
- PANOPTICON: A PII-Based Assemblage of Naturalistic Output Tokens for Investigating Privacy Leakage Within LLM Context Window
- Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning
- Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures
- RoleMix: Unifying Sequential and Non-Sequential Features via Semantic Tokenization for Post-Click Conversion Rate Prediction
- MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation
- SEGRA: Structured Experience-Guided Graph Reasoning Agent for Gremlin Based Question Answering
- Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning
- Commitment To Cooperation With Self-Negotiated Contracts
- Disentangling Multi-View Scanning in Mamba for Network Traffic Anomaly Detection
- Coordinated Networking for On-Device Agent-Augmented Real-Time Communication
- What Can Be Enforced? A Theory of Certified Runtime Safety for Tool-Using Agents
- Physical AI Governance: From Theory to Practice Across Life Cycle
- How Well Can AI Generate Backlogs from App Mockups?
- Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Coding Agent Teams
- SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI
- Design Theater: A Benchmark for Generative UI
- Let AI Agents Translate Networks, Not Reason About Them
- Share No More Than the Request Requires: Federated Disclosure for Perspective-Aware AI
- ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control
- Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming
- Stress-testing large language model agents in a robotic chemistry laboratory
- SymStep: Symbolic Step Verification for Logical Reasoning
- Structure over Depth: A Single-Block Spatio-Temporal Transformer for Multi-Entity Reasoning
- Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization
- SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows
- AgentOmnia: Scaling Agentic Models for Full-Scenario Applications
- CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion
- An Ontology for Machine Learning Interatomic Potentials
- Characterisation of Density-based FM generation methods in the context of Information Fusion
- CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics
- SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
- Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation
- MemTX: Transactional Belief Commit for Stateful Agent Memory
- Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
- GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models
- Understanding Human-like Solutions in Combinatorial Optimization via Learning and Search
- Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach
- ACM: Agentic Context Management for Long Horizon Tasks
- FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
- Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models
- FrED: External Data Influence Estimation via Domain Knowledge Graph Grounding
- Household Movement Detection in Mixed-Format Occupancy Data Using LLM-Based Entity Resolution
- TopoFE: topology-aware LLM-guided Automated Feature Engineering
- RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning
- Ordered Network Analysis of Epistemic Emotions during Collaborative Problem Solving
- ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications
- Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
- Key-Interval A*: Accelerating Grid Pathfinding via Structural Abstraction
- Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning
- NeurGO: Learning to Generate Elite Candidates for Meta-Black-Box Expensive Optimization
- Separating Capability from Permission: A Governance Framework for Agentic AI Autonomy Levels
- Do LLMs Know Their Vulnerable Scenarios?
- Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis
- ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness
- Verification-Notebook Learning for Source-Aware Multimodal Misinformation Detection
- Are You Still the Agent I Authorized? Earned Authority under a Fixed Ceiling for Evolving Agents
- Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning
- SpecAHD: Localize to Specialize for Automated Heuristic Design in Large-Scale Routing Problems
- Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems
- Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
- Offline-to-Online Creative Optimization with Generative Models and Adaptive Testing
- Offline-Online Curriculum RL for Multimodal Reasoning
- E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios
- Training Language Models to Cooperate with Inference-Time Controllers
- From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
- Cost-Aware Recovery-Pathway Identification and Bayesian Optimization for Autonomous Materials Discovery
- From Cognitive Architectures to Language Agents: A Mechanism-Level Review of Lineage, Convergence, and Migration Gaps
- DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models
- EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff
- Grokking on the Weight-Decay Clock: A Rate Hierarchy from Softly Broken Symmetries
- Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks
- Exploring Budgeted Image Classification with Content-Sensitive Resource Allocation
- Self-Supervised Consistency Enhanced Disentangled Learning for Neural Decoding Generalization in Brain-Machine Interface
- A Cyclic Adaptation-Generalization Framework with Uncertainty-Guided Self-Paced Learning for Long-Term Brain-Machine Interfaces
- The Half-Lives of Generative-AI Evidence: A 40-Record Audit, a Claim-Currency Framework, and a Reflexive Case of Frontier-Model-Assisted Research
- Quantum-Inspired Evolutionary Neighborhood Search for Arrival-Departure Track Utilization Adjustment under Short-Term Disturbances
- The Cost of Knowing: A Resource-Aware Protocol for Benchmarking Hallucination Beyond Static Leaderboards
- MiSS: A Logic-Driven Explanation of Minimal Sufficient Coalitions for Point Cloud Classifiers
- Scaling GUI Agents with Visual State Transitions
- MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents
- Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents
- Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning
- AI4PLE: A Methodology for Integrating AI into Product Line Engineering
- A Roadmap to Impactful Pluralistic Alignment Research
- Dynamic Capability Scoping for Enterprise AI Agents: A Synthetic Dataset and Three-Source Permission Architecture
- Agentic Root Cause Analysis through Evidence-Grounded Reasoning
- IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
- The Hard Decision Layer: Evidence for Committed Inference in Transformers
- SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text
- Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis
- Spectral Flow Certificates for Depth-Aware Long-Range Propagation in Graph Neural Networks
- TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
- Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices
- Securing Multimodal AI through Internal Information Decomposition
- Explainable Reinforcement Learning for assisting Air Traffic Controllers
- The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents
- TRACE-ROUTER: Task-Consistent and Adaptive Online Routing for Agentic AI
- SceneActBench: Can Agents Act on the 3D Scenes They See?
- Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI
- Learning Structural Convergence: A Neuro-Symbolic Benchmark for Temporal Reasoning
- TRW: TRACE-RealWorld---An Auditable Consistency Contract for World Models as Materialized Views
- Multi-Agent System-driven Digital Twins for predictive maintenance: architectures, technologies and open research challenges
- When Is a Learned Command Adapter Worth It? Closed-Loop Identification and Counterfactual Auditing of Frozen Locomotion Policies
- QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization
- What AI Red-Team Evaluations Can and Cannot Prove
- Persistent Computational State: A Session-Centric Runtime for Generative World Models
- Defining AI-Native Systems: Autonomy as Revision Authority
- Wavelet Phase Diffusion for Structurally and Semantically Consistent Sim-to-Real Translation
- Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization
- Source-Aware Reranking for Retrieval-Augmented Generation: A Reliability Prior Approach
- The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation
- MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models
- TriSP: Tri-Signal Structured Pruning for Large Language Models
- ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation
- Lexical discovery in unknown environments orchestrated by Large Language Models
- Structure Over Scale: Schema-Constrained Causal Graphs for RAG
- xMIx: High-Performance Serving-Time Platform for Mechanistic Interpretability Apps
- An Agentic Orchestration of Atomistic Simulations
- HyCE-RAG: Hypergraph Chain-of-Evidence Retrieval-Augmented Generation for Explainable Multi-hop Question Answering
- Differencing the Diffusion Trajectory toward Uncertain Components for Time Series Forecasting
- Chart Deception in Vision-Language Models: From Vulnerability to Mitigation
- DeepLook: Deeper Thinking with Lookahead
- Group Preference Collapse in Personalized Multimodal Large Language Models
- Evaluating LLMs as Interpretable Controllers for Dynamical Systems
- Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations
- Decentralized Granular Access Control for Agentic AI Systems in Critical Infrastructure
- DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training
- Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning
- CHS-SQL: A Text-to-SQL approach based on Confidence-Guided Heuristic Search Schema Linking process
- TokenMem: Faithful Knowledge Injection for Frozen LLMs
- Masked Distillation: Internalizing the Chain-of-Thought in Language Models
- VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing
- Evolving from Lessons: Skill-Augmented Table Graph Reasoning for Operation-wise Table Question Answering
- PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding
- CallBench: A Benchmark for Dual-Goal Coordination in Phone Call Assistants
- Answering Path Queries under Linear and Guarded Existential Rules
- Fast Cross-Scenario Adaptation of CSI Models via Channel Conditional Parameter Generation
- TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
- CRAFT: Learn the Schema, Execute the Plan
- Reason Before You Retrieve: Agentic Planning for Multi-modal RAG
- DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification
- Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models
- PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
- STAIF: A Stage-wise Optimization for Complex Instruction Following
- Myopia Prevention and Control 3.0: Artificial Intelligence--Driven Risk Stratification, Proactive Monitoring, and Personalized Intervention
- Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness
- Integrating Factual and Normative Industrial Knowledge via Constraint-Aware Graph Attention for Process Plan Recommendation
- Epistemic Norms for AI Safety and Alignment Research
- Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach
- From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- Unequal Trips, Unequal Places: Diagnosing and Mitigating Delay Inequity in Autonomous Vehicle Fleet Coordination
- Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families
- Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Age
- Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization
- Failures Reveal What Metrics Miss: An Evidence-Driven Agent for Recursive Refinement of ECG Classifiers
- Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis
- Making Mathematical Knowledge Explainable, Accessible and Interoperable Through Large Language Model Integration
- From Execution to Capability: Scientific Experience Consolidation via Procedural Knowledge Synthesis
- LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports
- DSCH-Loss: A Dynamic Semantic Channel Objective for Deep Semantic Hashing
- Efficiency Matters in Autonomous Research
- Reason-Mediated Behavioral Models for Auditing LLM Social Simulators
- Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating
- ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams
- Artificial Intelligence and Innovation Ecosystem: Evolutionary Developments, Challenges, and Future Directions
- SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents
- TRACE-CTI: Auditable Post-Extraction Governance of TTP Claims with Knowledge Graphs
- LLM-Assisted Ontology Engineering and Construction of a French Legal Knowledge Graph
- Falsifiable Commitment Planning for Self-Correcting Web Agents
- A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference
- Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems
- Towards High-Level Semantic Intelligence
Comments
Please log in to post a comment.