YouTube12 Aug 2026
13m

Memory Harnesses for Long-Running Research Agents — Stefania Druga, Sakana.ai

Podcast cover

AI Engineer

Long-horizon AI agents frequently suffer from context bloat, leading to contradictory outputs and task drift. A robust memory harness, structured as a write-manage-read loop, addresses this by integrating specific recall and archival mechanisms. Experiments using local models like Qwen 27B and DeepSeek V4 Flash reveal that a ranked recall policy significantly outperforms standard retrieval methods on complex benchmarks such as XBench. While memory is unnecessary for tasks fitting within a model's context window, it is critical for long-running operations. Notably, providing accurate ground-truth memory—an "oracle"—does not guarantee success, as models must still effectively interpret and prioritize retrieved information. Establishing a formal recall policy serves as a first-class metric for optimizing agentic performance, reducing token costs, and maintaining operational sovereignty in local AI deployments.

Outlines

Sign in to continue reading, translating and more.

Open full episode in Podwise