Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
Are you Talking Logic to Me? Assessing Language Models Syllogistic Reasoning Capabilities
Fast and Memory-Efficient Wavelet Convolutions via I/O-Aware Reformulation
SynWeaver: Website-Prior Task and Trajectory Co-Synthesis for Web Agents
TopoIntent: Compiling Security Intent into Executable, Compliance-Checked Network Topolog…
Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement
Security and Detectability Analysis of Unicode Text Watermarking Methods against Large La…
RadarGen: Automotive Radar Point Cloud Generation from Cameras
Learning Latency-Aware Orchestration for Multi-Agent Systems
INSHAPE: Instance-Level Shapelets for Interpretable Time-Series Classification
Early Warning Signals for OpenVLA Failure under Visual Distribution Shift
Vibe to Code: Elucidating Strategic Oscillation of Tacit Knowledge in Generative AI Desig…
CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinf…
REHEARSE: Experiential Rehearsal for Verbal Confidence Calibration in Large Language Mode…
Commit Locally, Exit Globally: Coordinating Adaptive Sampling and Early Exit in Diffusion…
CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language
StarEmbed: Benchmarking Time Series Foundation Models on Astronomical Observations of Var…
SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
Automated Design Optimization via Strategic Search with Large Language Models
How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for Grap…
Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning
MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models
Automatic Termination Strategy of Inelastic Neutron-scattering Measurement Using Bayesian…
Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking …
The Impact of Generative AI on Collaborative Open-Source Software Development: Evidence f…
Unmasking Conversational Bias in AI Multiagent Systems
Unlearning at Scale: State-Exact Trace-Preserving Deletion in Billion-Parameter Language …
Rule of Thumb: Explaining Artificial Intelligence Systems using Partial Information
Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs
Cueless EEG imagined speech for subject identification: dataset and benchmarks