Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoni…
Explorar
Noticias de IA
21863 elementos — filtrados, clasificados y sin duplicados
GRZO: Group-Relative Zeroth-Order Optimization for Large Language Model Fine-Tuning
Adaptive Latent Agentic Reasoning
Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions
A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs a…
WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents
SCOPE: Real-Time Natural Language Camera Agent at the Edge
Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliabl…
See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs
MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents
A Negative Result on Cross-Model Activation Transfer in a Pythia Multi-Hop Setting
Towards Non-Monotonic Entailment in Propositional Defeasible Standpoint Logic
OpenAgenet/OAN: Open Infrastructure for Trusted Agent Interconnection
TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning
Code-on-Graph: Iterative Programmatic Reasoning via Large Language Models on Knowledge Gr…
Enhancing Operational Safety via Agentic Dialogue Hazard Identification Analysis
EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement
Oscillatory State-Space Models as Inductive Biases for Physics-Informed Neural PDE Solvers
Aletheia: What Makes RLVR For Code Verifiers Tick?
Geometry-Aware Tabular Diffusion
ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL
Uncertainty-Aware Clarification in LLM Agents with Information Gain
Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge
Leave it to the Specialist: Repair Sparse LLMs with Sparse Fine-Tuning via Sparsity Evolu…
A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners
The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplac…
DTKG: Dual-Track Knowledge Graph-Verified Reasoning Framework for Multi-Hop QA
Brief Announcement: Generative Markov Model for Distributed Computing Systems
AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse
EqGINO: Equivariant Geometry-Informed Fourier Neural Operators for 3D PDEs