DarwinX: Evolving Agent Harnesses Through Natural Selection
Explorar
Noticias de IA
29341 elementos — filtrados, clasificados y sin duplicados
BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusio…
TRACE: TRajectory Attribution for Automated Context Engineering
Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discove…
Length-MAX Tokenizer for Language Models
Layerwise goal-oriented adaptivity for neural ODEs: an optimal control perspective
SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns
ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems
An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning
Temporal Sepsis Modeling: a Relational and Explainable-by-Design Framework
LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Rout…
C2L-Net: A Data-Driven Model for State-of-Charge Estimation of Lithium-Ion Batteries Duri…
Transformer-Based Neural Quantum Digital Twins for Many-Body Spectral Reconstruction and …
Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Ch…
Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasonin…
Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution
SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification
ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs
Modern Backbones Improve Multi-task DETR for Mammography Classification and Lesion Locali…
Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Inject…
Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Pr…
LGNNIC: Acceleration of Large-Scale GNN Training using SmartNICs
MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangl…
Renormalising Generative Models for Active Inference: Foundations, Derivations, and Verif…
Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models
Time-Series Forecasting in Safety-Critical Environments: An Open-Source Package for EU-AI…
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Lang…
Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipu…