Explorar

Noticias de IA

30334 elementos — filtrados, clasificados y sin duplicados

arXiv cs.AI Research & Papers
NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs
arXiv cs.AI Research & Papers
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Mode…
arXiv cs.AI Research & Papers
MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clini…
arXiv cs.AI Research & Papers
Improved Guarantees for Heterogeneous Treatment-Effect Estimation via Matrix Completion
arXiv cs.AI Research & Papers
In-Context Reward Adaptation for Robust Preference Modeling
arXiv cs.AI Research & Papers
On Language Generation in the Limit with Bounded Memory
arXiv cs.AI Research & Papers
Toward User Preference Alignment in LLM Recommendation via Explicit Context Feedback
arXiv cs.AI Research & Papers
PTCG-Bench: Can LLM Agents Master Pok\'emon Trading Card Game?
arXiv cs.AI Research & Papers
LLM-Evolved Domain-Independent Heuristics for Symbolic AI Planning
arXiv cs.AI Research & Papers
VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
arXiv cs.AI Research & Papers
PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data
arXiv cs.AI Research & Papers
A Matter of Interest: Understanding Interestingness of Math Problems in Humans and Langua…
arXiv cs.AI Research & Papers
InsightEval: An Expert-Curated Benchmark for Assessing Insight Discovery in LLM-Driven Da…
arXiv cs.AI Research & Papers
Benchmarking at the Edge of Comprehension
arXiv cs.AI Research & Papers
Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangle…
arXiv cs.AI Research & Papers
ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approxi…
arXiv cs.AI Research & Papers
Recurrent Structural Policy Gradient for Partially Observable Mean Field Games
arXiv cs.AI Research & Papers
DialToM: A Theory of Mind Benchmark for Forecasting State-Driven Dialogue Trajectories
arXiv cs.AI Research & Papers
FormalEvolve: Neuro-Symbolic Evolutionary Search for Diverse Autoformalization
arXiv cs.AI Research & Papers
When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision-La…
arXiv cs.AI Research & Papers
MediHive: A Decentralized Agent Collective for Medical Reasoning
arXiv cs.AI Research & Papers
GroundAct: Can LLM Agents Ground Actions in Environmental States?
arXiv cs.AI Research & Papers
S-MARC: Causal Streaming Reasoning for Full-Duplex Conversational Behavior Modeling
arXiv cs.AI Research & Papers
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
arXiv cs.AI Research & Papers
Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet
arXiv cs.AI Research & Papers
Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-ground…
arXiv cs.AI Research & Papers
CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval
arXiv cs.AI Research & Papers
Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting
arXiv cs.AI Research & Papers
AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Cryst…
arXiv cs.AI Research & Papers
Surfacing Isolated Learners with Outcome-Independent Mediation of Feedback between Teache…