ImageImage
A one-day, invite-only summit providing a first look at the benchmarks and research that will shape the frontier.

October 8, 2026

San Francisco

Image
Image
Image
Image
Image
STELLA-Bench
Image
Paperena
Image
MedPAIR
FutureSim
AgentAbstain
CollusionBench
HalluWorld
Train-to-Test (T²) Scaling Laws
HumanOversight Bench
JudgmentBench
Image
Image
ORCA-Bench

Topics

Image
Environment complexity

Evaluating agents in realistic, dynamic, tool-rich environments.

Image

Autonomy horizon

Measuring how far agents can act independently over long horizons.

Image

Output complexity

Scoring sophisticated, verifiable, multi-artifact deliverables.

Speakers and Presenters

Image

François Chollet

Co-Creator

ARC Prize

Creator

Keras & ARC-AGI

Image

Dawn Song

Professor, Computer Science

UC Berkeley

Director

Berkeley RDI

VP of AI Research

Meta

Image

Sudip Roy

Co-Founder & CTO

Adaption

Image

Sanmi Koyejo

Director

Stanford STAIR Lab

Co-Founder

Virtue AI

Image

Niko Grupen

Head of Applied Research

Harvey

Image

Braden Hancock

AI Researcher & Investor | Partner

Laude Institute

Image

David Hall

Member of Technical Staff

Open Athena

Image

Alex Ratner

CEO & Founder

Snorkel AI
Image

Alex Shaw

Co-Creator

Terminal Bench & Harbor

Image

Steven Dillmann

PhD Student

Stanford University

Project Lead

Terminal-Bench-Science

Image

Yiyou Sun

Postdoc
UC Berkeley

Co-Project Lead

AgentLE
Image

Xinyang (David) Han


PhD Student

UC Berkeley

Co-Project Lead

AgentLE
Image

Weichen Zhang

PhD Student

UC San Diego

Co-Project Lead

AgentLE

Image

Russell Yang

Applied Scientist

Microsoft
Project Lead

JudgmentBench

Image

Riya Ranjan

Research Staff

Stanford University

Project Member

JudgmentBench

Image

Pierce Kelaita

Applied Research, Liftlab,

Stanford Law School

Project Member

JudgmentBench

Image

Annas Bin Adil

CTO
Atella.ai

Co-Project Lead

STELLA-Bench
Image

Kelly Buchanan

Postdoctoral Researcher
Stanford University
Project Lead
Terminal Bench 2.1
Image

Gabriel Orlanski

PhD Student
University of Wisconsin-Madison
Project Lead
SlopCodeBench
Image

Nicholas Roberts

Postdoc Fellow

Princeton University
Project Lead
Train-to-Test (T²) Scaling Laws
Image

Virginia Smith

Associate Professor
Carnegie Mellon University
Faculty Lead
CollusionBench
Image

Aashiq Muhamed

PhD Student

Carnegie Mellon University

Project Lead

CollusionBench
Image

Vincent Sunn Chen

Founding Team
Snorkel AI
Image

Anmol Kabra

PhD Student 

Cornell University

Project Lead

PhantomEnvironments

Image

Dongyeop Kang

Assistant Professor

University of Minnesota

Faculty Lead

SciVeri-Bench

Image

Young-Jun Lee

Visiting Scholar

University of Minnesota

Project Lead

SciVeri-Bench

Image

Emmy Liu

PhD Student

Carnegie Mellon University

Project Lead

HalluWorld

Image

Harit Vishwakarma

Senior Postdoctoral Research Fellow

University of Oxford

Project Lead

Paperena

Image

Thomson Yen

PhD Student

Columbia University

Project Lead

MBABench

Image

Kit Dobyns

Co-Founder

Atella.ai

Co-Project Lead

STELLA-Bench

Image

Yuexing Hao

Researcher

Microsoft

Project Lead

MedPAIR

Image

Shashwat Goel

Student Researcher

Google

Co-Project Lead

FutureSim

Image

Nikhil Chandak

PhD Student

Max Planck Institute

Co-Project Lead

FutureSim

Image

Arvindh Arun

Research Scientist Intern

Sakana AI

Co-Project Lead

FutureSim

Image

Xun Liu

PhD Student

University of Illinois Urbana-Champaign

Project Lead

AgentAbstain

Image

Jackson Clark

PhD Student

University of Illinois Urbana-Champaign

Project Lead

SREGym

Image

Kyuseong Choi

Statistics PhD Candidate

Cornell Tech

Project Lead

ORCA-Bench

Image

Albert Gong

PhD Student

Cornell University

Project Lead

ORCA-Bench

Shaping the frontier of AI

Livestream

Stay updated on
event announcements