Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
CHARM: Character Hallucination for Multicultural Role Play Benchmark
Provably Safe Sim-to-Real Transfer
Towards Provable and Scalable Training of Quantized Neural Networks with Ising Optimizati…
Analog-DB: An Agent-First Analog Integrated Circuit Database, From Blocks to Systems
LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting
Neuro-Symbolic Geometric Abstraction (NeuSOGA): From Observations to Symbolic Mathematica…
3D-Consistent Multi-View Editing by Correspondence Guidance
AgentFactory: Towards Automated Agentic System Design and Optimization
H2Table: Hierarchical Hypergraph-Enhanced Large Language Models for Complex Table Reasoni…
Data-Driven Persona-Conditioned Agents for A/B Test Simulation
User Representation via Cross Multi-source Behavior Pre-training for Mobile Games
Spawn Freely, Act Sparingly: Progressive Risk Vesting for Recursive LLM-Agent Trees
Athena: Vulnerability-Affected Library Identification via Knowledge Graph Completion
Prompt-Robust Language Models: Which Training Strategies Work?
Counterfactual Fragility Certificates: Exposing High-Confidence Brittleness under Structu…
StainPresetNet: Stain Preset Network for Fast Multi-to-Multi Stain Normalization
Figures as Programs: Recursive Generation of Editable Scientific Figures
Few-Shot Out of Domain Intent Detection with Covariance Corrected Mahalanobis Distance
RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation
TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models
CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training
Towards reliable multimodal disaster severity assessment through preference optimization …
CacheBridge: Efficient Cross-Model KV Cache Transfer
EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
EDRAC: Benchmarking Arabic Dialect Reading Comprehension
On Synthesis of Metric Interval Temporal Logics
Revisiting Face Recognition for Monozygotic Twins: The Celeb Twins Test Set
Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling
Text-guided flow matching enables sample-efficient crystal structure generation