Solver-Aware Decompositions for Programming-by-Example: When Dividing Requires Knowing ho…
Explorar
Noticias de IA
37834 elementos — filtrados, clasificados y sin duplicados
LeanMem: Simple and Efficient Long-Term Memory for LLM Agents
ChartAnno: Evaluating MLLMs for Chart Annotation Generation
When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO
ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable…
WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and S…
Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Auto…
Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes
Behaviorally Adaptive Visual Diversion for Inclusive and Resilient Digital Assessment Del…
Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
Enhancing Tabular Learners with Context-Aware Semantic Embeddings
Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Cap…
From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open…
FOUND-AF: Benchmarking ECG Foundation Models for Atrial Fibrillation Detection
FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation
Formal Verification of Agentic Systems over Operational Data
Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observat…
Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection
Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bou…
AutoSND: From Execution Evidence to Structural Policies for Automated Network Dismantling…
Shielding for Higher-Order Safety
PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud
TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Ag…
When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine…
SAT-Edge-Agent: Hardware-in-the-Loop Edge-Agent Orchestration for Onboard Satellite Intel…
CARE-Bench: Benchmarking Patient-Facing LLM Triage
Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improve…
AgenticECO: An Agentic Framework for ECO on 3D Integrated Circuits
MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Sy…