diff --git a/packages/paperclip-runner/docs/images/evalbook-chat/failed.png b/packages/paperclip-runner/docs/images/evalbook-chat/failed.png new file mode 100644 index 0000000000..21d4be7419 Binary files /dev/null and b/packages/paperclip-runner/docs/images/evalbook-chat/failed.png differ diff --git a/packages/paperclip-runner/docs/images/evalbook-chat/missing-recording.png b/packages/paperclip-runner/docs/images/evalbook-chat/missing-recording.png new file mode 100644 index 0000000000..57eba71894 Binary files /dev/null and b/packages/paperclip-runner/docs/images/evalbook-chat/missing-recording.png differ diff --git a/packages/paperclip-runner/docs/images/evalbook-chat/passed.png b/packages/paperclip-runner/docs/images/evalbook-chat/passed.png new file mode 100644 index 0000000000..1c28f8f565 Binary files /dev/null and b/packages/paperclip-runner/docs/images/evalbook-chat/passed.png differ diff --git a/packages/paperclip-runner/docs/runner-protocol-live-evals.md b/packages/paperclip-runner/docs/runner-protocol-live-evals.md index 0a0643f643..9019b78983 100644 --- a/packages/paperclip-runner/docs/runner-protocol-live-evals.md +++ b/packages/paperclip-runner/docs/runner-protocol-live-evals.md @@ -33,6 +33,13 @@ Add `--screenshots /path/to/proof` for visual evidence. Public screenshots are retained in the aggregate Actions artifact, not added to the public report's closed file allowlist. +These screenshots are generated acceptance-test evidence from the scrubbed +completed campaign, not a separate report design: + +![Passing chat replay with expanded tool evidence](images/evalbook-chat/passed.png) +![Failed chat replay with visible assertions](images/evalbook-chat/failed.png) +![Missing recording shown in the same viewer](images/evalbook-chat/missing-recording.png) + ### Refresh a completed report without calling models Download the aggregate Actions artifact, then: