Research Brief
Key Takeaways
- • Key findings from research papers
Sources
- Enhancing LLMs with Context-Specific Knowledge for Mitigating Misinformation in SMEs: A RAG-based Modeling and Analysis
- AutoFOAM: The Self-Refining Autonomous OpenFOAM Agent
- Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale
- Shared Organizational Memory for Enterprise Coding Agents: System Design and Deployment Snapshot
- Personalizing Large Language Model Agents with Small Policy Models
- TRACE-TS: Attribution-Grounded and Traceable Sensor-Language Reasoning for Human Activity Understanding
- Geometric Self-Supervised Pre-training for Neural Combinatorial Optimization
- Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces
- Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations
- CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding
- Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models
- HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging
- DASH: Decoupled Adaptive Surrogate - Acquisition Harness for Automated Bayesian Optimization
- Slides2MindMap: Reconstructing Cognitively Efficient Knowledge Hierarchies from Lecture Slides
- Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
- Evolutionary Curriculum Learning Improves Biological Sequence Modeling
- FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds
- Toward Fine-Grained Forgetting:Attribute Unlearning for Multimodal Large Language Models
- Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races
- Co-evolution of social reward and punishment under institutional interventions
- Reputation-driven Cooperation in Lattice-based Decentralized Federated Learning through Evolutionary Game Theory
- CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories
- Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
- Securing Agentic AI: From Per-Action Checks to Trajectory Assurance
- Emergence Invariance: From Symbolized Thought to Interface Refinement
- Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning
- When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses
- Leveraging AI for fine-grained food safety risk forecasting in sparse data conditions
- Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
- Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
- EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning
- Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning
- Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning
- SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
- Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit
- MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4
- Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
- Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
- ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision
- Real-Time Detection and Repair of LLM Agent Failures
- Trustworthy AI in Digital Health: A Comprehensive Review of Robustness and Explainability
- PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs
- MEGRAG: Multi-Granular Evidence Graphs for Answer-Aware Multi-Hop RAG
- PAC Approximation and DIRECT Optimization for Parametric Markov Models
- Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents
- CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents
- ReasonCast: Towards Explainable Time Series Forecasting with Reasoning
- Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge
- Physics-Informed Neural Networks for Complex Eigenfrequency Identification and Mode Structure Reconstruction of the Ground-State ITG Branch
- AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies
- Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation
- Optimizing Minimax Regret in Uncertain MDPs with Small Sets of Policies
- Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation
- Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models
- FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
- Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination
- Memory Reward Inflation in Self-Improving LLM Agents
- Nova: An End-to-End MLIR Compiler for Deep Learning
- Linguistic Context Recodes Visual Representations in Vision-Language Models
- Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates
- FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
- Behavioral Grammar: Detecting Adaptive Malware via Tiny Language Model Priors and Second-Order Temporal Analysis
- Isotropy Cliffs: The Geometric Signature of Decision-Making in Large Language Models
- Neuro-Evolved Heuristics for Variable Gapped Common Subsequence Identification
- TrajWiki: Source-Grounded Memory Trajectories for Long-Horizon Dialogue Agents
- Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel
- Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
- MA-HEAD-Net: Adaptive Rule-Guided Multi-Agent DRL for AoI Minimization in UAV-Assisted Emergency Networks
- G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution
- MRAFnd: Multimodal Retrieval-Augmented Framework for Zero-Shot Fake News Detection
- Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning
- SearchMaster: Grounded and Regulated Self-Play for Search Agents
- Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study
- Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
- Homebot: A Personal AI Agent for Conversational Home Assistance and Automation
- SkillTrace: Traversing a Query-Skill Graph for Composable LLM Agents
- KC-Agent: A Dual-Process Cognitive Architecture for Efficient ML Model Improvement
- A Taxonomy of Cognitive Capability Gaps in Generative and Agentic AI
- REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models
- Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result
- Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
- Self-Certification of Representation Adequacy: Sequential Certification at Minimum Task Loss
- From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
- Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints
- Evolving in the Agent Jungle via History-Informed Opponent Awareness
- A Contractualist Argumentation Framework for Moral Decision-Making
- ProWorld: Progress-Aware Hyperbolic World Models for Long-Horizon Visual Goal Reaching
- xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
- MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models
- Faster-WAM: Do World Action Models Need Deep Action Modules?
- Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling
- Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection
- HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning
- EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers
- Before Reasoning Fails: Pre-Evidence Procedural Failures in Agentic RAG
- HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents
- PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
- Rewriting or Reweighting? A Geometric Account in Language Models
- CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits
- LaCache: Robust Semantic Caching for LLM Serving
- Constructing Executable Analytical Knowledge Representations for Meta-Analysis Synthesis Using an Agentic Harness
- Beyond Single-Use Tokens: Durable Authorization State for Replay-Resistant LLM Agent Actions
- GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks
- When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary
- Where Reasoning Diverges: Localized Multi-Agent Debate
- Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI
- A New Theory of Value for Post-AGI Economics
- PolymerGPT: Multi-property Optimization with a Decoder-Based GPT Model for Generative Polymer Design
- Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating
- Modeling Social Dynamics with an LLM-Enabled Agent Based Network-Dynamic (LAND) Model
- CADIR: A Cross-Backend Editable Intermediate Representation for Agentic CAD Generation
- Assuming You Knew: Fixing an Epistemic Semantics for Flow Policies Using Agentic AI
- Similarity Weighted Aggregation with Global Differential Privacy for Federated Brain Lesion Segmentation
- The Scaling Paradox in Human-AI Collaboration
- Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems
- BayesSeg: A Bayesian Optimization Framework for State Segmentation of Electricity Consumption Time Series
- TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation
- RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning
- Trust and Its Betrayal under Three Representational Strategies
- CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization
- CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection
- Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware
- Revisiting Classic Thought Experiments to Measure Consciousness for Artificial Intelligence Safety
- MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
- Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents
- V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory
- From AI Technical Debt to Agentic Technical Debt: A Systematic Mapping of Root Causes and Manifestations in Agentic AI Systems
- SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling
- Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable
- Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering
- The Bayesian Reflex: A Predictive Coding Engine for Artificial Intelligence
- F-WANDA: Fisher-Reweighted Post-Training Pruning for Sustainable Deployment of Large Language Models
- Ekova: A Personality-Support Agent for Self-Discovery Dialogue
- TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs
- CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization
- Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions
- Infinite Trace Objectives with Finite Trace Techniques: Translating LTL to LTLf+
- Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce
- DAPD: Dual-Anchored Policy Distillation
- CRAFTS: Collaborative Role-Adaptive Fine-Tuning of LLM Agents for Chemical Process Simulation
- High-Stakes Decisions with Language Models: Insights from Emergency Triage
- Agentic Stage-One Stellarator Optimization: Autonomous Multi-Objective Search for Finite-Beta Equilibria
- 402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments
- Cognitive Demand Steering for Adaptive Meta-Reasoning in Large Language Models
- Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation
- AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment
- Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations
- DGA$_2$D: Directed Graph-Guided Automated Algorithm Design with Large Language Models
- AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints
- Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce
- H+ Embedding: Harmonizing Global and Token-Level Retrieval with Context-Dependent Phrases
- RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models
- MemSIF: From Structured Interactions to Dual-Track Fact Memory for LLM Agents
- CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
- SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems
- RL-Lock: Reinforcement Learning for Generating Interlocking Assemblies
- TCPO: Turn-Level Credit Policy Optimization
- Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
- LongCat Sparse Attention: Taming the Lightning via Streaming-aware Hierarchical Cross-Layer Indexing
- GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks
- Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw
- Computing with Agentic Oracles
- Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics
- No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks
- Perspectives on Tsallis Statistics for Artificial Intelligence
- The Graph Language: How Knowledge Graphs Speak to Large Language Models
- PATH-Bench: Path-Dependent Evaluation of Lifelong Agents
- Inter-Residue Geometry Attention for Antibody-Specific Epitope Prediction
- Role-Decoupled Attention Residuals: Separating Matching and Content Retrieval Across Depth
- PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
- PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
- WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation
- RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals
- More Debate, Same Evidence: Structural Limits of Homogeneous Multi-Agent Groundedness
- Request-Level Energy Attribution for Batched LLM Serving
- Optimization and Constraint Modeling using LLMs with a Retrieval Augmented Generation Process
- CT-PrepAgent: Bounded Policy and Controlled Execution for Adaptive CT Data Preparation
- Beyond Solution-Centric Search: Adaptive Inquiry and Knowledge Revision for Autonomous ML Engineering
- Large language models improve physician accuracy but lead to false reliance
- Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification
- CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning
- Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer
- Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning
- MineGrad: Gradient Inversion Attacks on LoRA Fine-Tuning
- Sweet Little Lies: Strategic Deception in AI Emotional Support Chatbots
- KoVRE: Training an Efficient Embedding Model for Korean Visual Document Retrieval
- Control Under Compression: Reliability Frontiers for Tool-Using Agents
- Don't Offer What Can't Be Done: Deterministic Executability Gating for LLM Skill Selection at Scale
- Mask-Based Priors Are More Persistent than Query-Key Initializations
- SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs
- Where did the ambiguity go? Examining how multimodal models interpret polysemous words
- Gene Ontology-Guided Hierarchical Spatial Gene Expression Prediction from Histopathology Images
- Bayesian and Motivated Reasoning in AI Agents
- When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty
- AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?
- FRAMES: Guarded and Dual-Objective Skill Evolution for Agents in Policy-Governed Enterprise Workflows
- Motif-Mamba: network motif improved mamba for long-range sequence modeling
- Chess on Ice: Curling Tactical Decision-Making via Backward Induction and Deep Reinforcement Learning
Comments
Please log in to post a comment.