From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and R…
Explorar
Noticias de IA
30329 elementos — filtrados, clasificados y sin duplicados
TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech
SCOPE: Prompt Evolution for Enhancing Agent Effectiveness
Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents
Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs
Causal-JEPA: Learning World Models through Object-Level Latent Masking
Dynamics Within Latent Chain-of-Thought: An Empirical Study of Causal Structure
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large L…
AgentDropoutV2: Optimizing Information Flow in Multi-Agent Systems via Test-Time Rectify-…
SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vis…
MemCollab: Cross-Model Memory Collaboration via Contrastive Trajectory Distillation
Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in M…
Guardrails Beat Guidance: A Large-Scale Study of Rules, Skills, and Persistent Configurat…
SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning
SciHorizon-DataEVA: An Agentic System for AI-Readiness Evaluation of Heterogeneous Scient…
Human-Guided Harm Recovery for Computer Use Agents
AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence
NOVA: Fundamental Limits of Knowledge Discovery Through AI
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Hum…
Crafting Desirable Climate Trajectories with RL Explored Socio-Environmental Simulations
GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Det…
PhoneWorld: Scaling Phone-Use Agent Environments
Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generati…
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Mul…
Composing Non-Conjugate Factor Graphs with Closed-Form Variational Inference
How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignmen…
TRACER: Persistent Regularization for Robust Multimodal Finetuning
The Good, the Bad, and the Ugly of Markov Boundary for Tabular Prediction
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents