LLM-Based Code Documentation Generation and Multi-Judge Evaluation
Explorar
Noticias de IA
22116 elementos — filtrados, clasificados y sin duplicados
The Interlocutor Effect: Why LLMs Leak More Personal Data to Agents Than Humans
Whisfusion: Parallel ASR Decoding with Masked Diffusion
Janus: A Benchmark for Goal-Conditioned Information Distortion in LLMs
Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstr…
More Human or More AI? Visualizing Human-AI Collaboration Disclosures in Journalistic New…
Geometrically Averaged Hard Target Updates for Linear Q-Learning
An LLM-Native Psychometric Instrument Does Not Predict LLM Behavior: Evidence Across 25 M…
Self-EmoQ: Plutchik-Guided Value-based Planning to Drive Streaming Emotional TTS
On the Condition Number Dependency in Bilevel Optimization
AI-Driven Analytics of Team-Teaching Talk: Acoustic Patterns across Experience, Cohorts a…
CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks
When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models
Dep-LLM: Training-Free Depression Diagnosis via Evidence-Guided Structured Multi-factor w…
Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding
CleanPatrick: A Benchmark for Image Data Cleaning
Expert-Level Crisis Detection in Mental Health Conversations
ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning
One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA
Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory
The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Mi…
AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies
Accelerating NeurASP with vectorization and caching
Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation
Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation
Large-scale semantic mapping of learner agency and autonomy reveals what measurement and …
Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution
Detecting Knowledge Gaps from Conversational AI Interactions Using Curriculum Prerequisit…
HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning
Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages