Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evalu…
Explorar
Noticias de IA
29349 elementos — filtrados, clasificados y sin duplicados
When Should Memory Stay Silent: Measuring Memory-Use Boundaries in Memory-Augmented Conve…
Assessing the Geographic Diversity of AI's Platial Representations in Image Generation
Finite Element-Based Material Learning via Automatic Differentiation: Learning constituti…
Calibrated Surprise: An Information-Theoretic Account of Creative Quality
X-Band UAV-enabled Integrated Sensing and Communications for Vehicular Networks
ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction
Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
Exploring LLMs for South Asian Music Understanding and Generation
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchm…
Unsupervised Pattern Analysis in Japanese Veterinary Toxicology: A Regulatory-Compliant F…
MASF: A Multi-Model Adaptive Selection Framework for Abstractive Text summarization
Personal AI Agent for Camera Roll VQA
Uncertainty Aware Functional Behavior Prediction and Material Fatigue Assessment for Circ…
GITCO: Gated Inference-Time Context Optimization in TSFMs
How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field …
LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformaliz…
SentinelBench: A Benchmark for Long-Running Monitoring Agents
Towards Unified and Data-Efficient Prognostics and Health Management with Tabular Foundat…
A Finite Certificate for the Positive $n=9$ Vasc Inequality
Harnessing Structural Context for Entity Alignment Foundation Models
GOTabPFN: From Feature Ordering to Compact Tokenization for Tabular Foundation Models on …
RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
A Motivational Architecture for Conversational AGI
Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference…
PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety E…
Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summariza…
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for…