Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems
Explorar
Noticias de IA
22065 elementos — filtrados, clasificados y sin duplicados
When benchmark inferences do not compose: Projectibility in AI evaluation
MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning
GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text
Predict before you train: Scaling Laws for particle physics foundation models
SCOPE: Synthetic Conditional Objectives for Policy Evolution in Black-Box Combinatorial O…
BlindPSNR: A No-Reference Fidelity Predictor for Low-Light Image Enhancement
MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing
From Minds to Models: The Intersection of Psychology and LLM Behaviours
Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA
A Montage-Agnostic Encoder for Calibration-Light Cross-User Gesture Recognition from Surf…
Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CA…
Cross-Embodiment Transfer via Behavior-Aligned Representations
Schreier-Coset Graph Rewiring
AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
From Classification to Regression: Using a Fruitfly to Solve Equations
APEX-Accounting
Inverse Learning of Latent Risk-Neutral Densities from Irregular Option Quotes
The Social Cost of an AI Teammate: How an Artificial Teammate Reshapes Human-Human Commun…
DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, L…
Improving Item Discoverability in e-Commerce Search via Related Intent Generation
SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Prog…
OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Econo…
Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Crit…
Voronoi Histograms for Adaptive Vectorization of Expected Persistence Diagrams
InferScale: GPU-Native KV Injection for Personalized LLM Serving
SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscri…