ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis
Explorar
Noticias de IA
29673 elementos — filtrados, clasificados y sin duplicados
To Use AI as Dice of Possibilities with Timing Computation
Counterfactual Trace Auditing of LLM Agent Skills
Regret-Based Federated Causal Discovery with Unknown Interventions
Agentic Physical AI toward a Domain-Specific Foundation Model for Energy Systems: A Case …
SAC-Opt: Semantic Anchors for Iterative Correction in Optimization Modeling
Breaking Information Cocoons: A Hyperbolic Framework for Balancing Exploration and Exploi…
Auto-Discovery-Bench: Diagnosing Structured State Tracking in Oracle-Guided Discovery
ReTabAD: A Benchmark for Restoring Semantic Context in Tabular Anomaly Detection
Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems
Neuro-Symbolic Predictive Process Monitoring
Symbolic Intermediaries as a Linguistic-Numerical Interface for LLM-Driven Geometric Reas…
SHIELD: Secure Hypernetworks for Incremental Expansion Learning Defense
PictSure: Pretraining Embeddings Matters for In-Context Learning Image Classifiers
Target-Agnostic Calibration under Distribution Shift with Frequency-Aware Gradient Rectif…
Human Psychometric Questionnaires Mischaracterize LLM Behavior
LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenar…
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
SPECTRA: Synthetic IR Test Collections with Relevance Oracles and Controlled Distractor D…
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
Conditional Coverage Diagnostics for Conformal Prediction
SpectralTrain: A Universal Framework for Hyperspectral Image Classification
If LLMs Have Human-Like Attributes, Then So Does Age of Empires II
Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Poli…
Scaling Conversational Hungarian ASR: The BEA-Dialogue+ Corpus
The Refutability Gap: Challenges in Validating Reasoning by Large Language Models
Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Languag…
Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data
Pull Requests as a Training Signal for Repo-Level Code Editing
CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability