ASA: Backbone-Training-Free Representation Engineering for Tool-Calling Agents
Explorar
Noticias de IA
29670 elementos — filtrados, clasificados y sin duplicados
MemCast: Memory-Driven Time Series Forecasting with Experience-Conditioned Reasoning
Structure-Preserving Learning Improves Geometry Generalization in Neural PDEs
Learning Evidence Highlighting for Frozen LLMs
Generating Concept Lexicalizations via Dictionary-Based Cross-Lingual Sense Projection
GRID: Scaling Task-Agnostic Inference in Continual Prompt Tuning
Quantifying Perception-Based Student Success with Generative AI: An Exploratory Monte Car…
ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark
NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devices
When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models
Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimizati…
Expert-Level Crisis Detection in Mental Health Conversations
HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning
A Reliable Fault Diagnosis Method Based on Belief Rule Base Consider Robustness Analysis
Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models
Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Un…
Structure from Reasoning, Numbers from Search: On-Premise Open LLMs as Structural Priors …
CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs
A History-Aware Visually Grounded Critic for Computer Use Agents
ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity
The Role of Feedback Alignment in Self-Distillation
More Human or More AI? Visualizing Human-AI Collaboration Disclosures in Journalistic New…
AI-Driven Analytics of Team-Teaching Talk: Acoustic Patterns across Experience, Cohorts a…
CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks
Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS
An LLM-Native Psychometric Instrument Does Not Predict LLM Behavior: Evidence Across 25 M…
LLM-Based Code Documentation Generation and Multi-Judge Evaluation
Can Multi-Agent LLMs Identify Their Peers? Stylometric Fingerprinting in Role-Constrained…
Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models
Mitigating Manifold Departure: Uncertainty-Aware Subspace Rectification for Trustworthy M…