Improving Proficiency and Efficiency of Android GUI Agents via Self-Generating Tool Actio…
Explorar
Noticias de IA
27413 elementos — filtrados, clasificados y sin duplicados
The Internal Anatomy of Strategic Choice in Large Language Models
More Than Mimicking Reviewers: Evaluating LLMs for Pre-Submission Peer Review
The Normalization of Deviance in AI Development
Scratchy: Visual-Scratchpad Multimodal Reasoning for Cryptographic Proof Generation in Ea…
From Monolithic Blending to Agentic Orchestration: Dynamic Response for Conversational As…
Distilling Vision-Language Models for On-Device Fire Understanding
Beyond Final Decisions: A Process-Centric Benchmark for Transparent AI-Assisted Peer Revi…
Scoring Without the Engine: Validating a Deterministic, Manipulation-Resistant Content Sc…
Do Large Language Models Know What They Don't Know II? A Fully Behavioral, Non-Cognitive …
Quantization Amplifies Determinism, Not Bias: Scale-Dependent Behavioral Effects of Servi…
CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning
Neptune: An AI model for Global Ocean Subseasonal Prediction
Leveraging Cardiac Imaging to Improve ECG-Based Detection of Chagas Disease in Resource-C…
SynthRCT: Scalable Conditional Deformation Synthesis for Synthetic Repeat CT Generation
From Where to How: Continuous 4D Interaction Forecasting from Egocentric Video
Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses
Norms at a Price: Why RL-Based Alignment Can Promise Conditional Compliance at Best
Deep belief networks are exact
EnvCraft: Synthesizing Executable Environments in Agentic RL for Claw-like Agent
The convergent laboratory: when AI reasoning, autonomous experiments, high performance an…
Recovering Temporal and Geographic Signals from Language Model Embeddings
What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record f…
A Tool-Augmented, GPT-4 Chatbot for Real-Time Repository Data Analysis
A radiographic world model for clinical reasoning and evidence generation
MVFA: A Multi-View Text-Guided Multimodal Fusion LLM Adapter for Sentiment Analysis and E…
SciLitBench: Benchmark and Design Principles for LLM-Powered Systematic Literature Reviews
Reasoning-Aware Compression: Identifying and Protecting Vulnerable Reasoning Circuits for…
From Simulated Citizens to Simulated Deliberation: Challenges in Representation and Inter…
CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Gen…