루프 밖에서.
당신의 AI 에이전트 블랙박스를 열어보세요. 낭비는 에이전트 안이 아니라 사이에 있습니다.
같은 질의로 두 번 도는 검색, 넘겼다가 같은 답을 되받는 플래너. Boxdawn은 트레이스를 읽어 에이전트가 이미 한 일을 다시 한 지점을 찾습니다. 감지는 오늘 돌아갑니다. 브라우저에서도, 여러분 머신에서도.
$ pip install boxdawn로컬 실행 · 계정 없이 시작 · 오픈소스 · LLM-judge는 opt-in

17,881 트레이스 · 공개 코퍼스 4종 · MIT 라이선스
Claude Code 세션 28건 · 22개 프론티어 모델의 Toolathlon 트래젝토리 6,780건 · Exgentic 에이전트-LLM 트레이스 10,056건 · 우리가 수집하지 않은 Claude Code 세션 1,017건
이 도구들 중 아무것도 그 사이를 보지 않습니다.
APM은 서비스를, 추적 도구는 단일 에이전트를, 게이트웨이는 개별 호출을 감시합니다. 어느 것도 보지 않는 것은 단계가 잘못된 뒤 에이전트가 하는 일입니다. 다시 시도합니다. 호출을 다시 하고, 파일을 다시 읽고, 컨텍스트를 다시 보냅니다. 청구서에 도착하는 것은 그 재시도이고, 그 사이의 틈에서 벌어집니다.
Boxdawn은 찾아낸 낭비에 이름을 붙이는데, 그중 하나가 에이전트가 같은 오류를 두 번 받은 경우입니다. 대개 오류 메시지를 읽지 않고 같은 인자로 다시 호출한 것입니다. 동일한 질의에 두 번 발동하는 리트리버. 위임했다가 같은 결과를 돌려받고 다시 위임하는 플래너. 어느 것도 단일 스팬 안에서는 보이지 않고, 전부 값을 치릅니다.
값싼 필터가 먼저, 비싼 검증은 그다음.
Boxdawn은 트레이스를 그래프로 읽어 2단 캐스케이드로 실행합니다. 구조 패스는 마이크로초 단위로 후보를 걸러내고, 의미 패스는 살아남은 것만 봅니다. 전체를 훑지 않습니다.
같은 에이전트가 같은 입력으로 다시 실행됩니다. 그 사이에 새로 유입된 정보는 없습니다. JSON 리포트의 비용 breakdown 에서는 provable_duplicate 로 키잉되고, 대시보드가 그 이름으로 조회하는 이유가 그것입니다. 그 옆의 waste-rate 블록은 repeat 을 씁니다.
매 API 호출마다 대화 전체가 다시 전송됩니다. 긴 에이전트 세션에서는 input 토큰의 약 97%가 재전송 컨텍스트(byte-exact 청크 매칭)로 누적됩니다.
같은 파일이 사이에 쓰기 없이 여러 번 Read 됩니다. 컨텍스트에 이미 있는 것을 잊는 코딩 에이전트에서 흔합니다.
에이전트 바깥의 무언가를 바꾸는 도구가 같은 입력으로 두 번 실행되고, 두 실행이 서로 다른 id 를 돌려줍니다. 두 번째 호출이 두 번째 개체를 만든 것입니다. id 가 같으면 같은 개체이고, id 를 돌려주지 않는 도구는 어느 쪽으로도 판정하지 않습니다.
바이트는 다르지만 의미가 같은 두 메시지 청크(paraphrased 재전송). opt-in LLM-judge 층이 감지 · 기본 비활성 · API 키 필요.
Opt-in 전용 · ANTHROPIC_API_KEY 필요
pingpong은 실제 멀티에이전트 트레이스가 있어야 나타납니다. 단일 에이전트 코딩 세션이나 Toolathlon에서는 발생하지 않습니다.
pingpong 은 구현돼 있지만 위 카드에는 넣지 않았습니다. 리포트가 그 이름을 붙이는 것은 pingpong 검출기가 직접 낸 쌍뿐이고, 낭비율 지표는 이름으로 그것을 제외합니다.
참고: 네 번째 후보 패턴이었던 regen_handoff은(는) 사전 등록 기준을 통과하지 못해 제외되었습니다. Proven / Not Yet 섹션 참조.
증명된 것. 아직 아닌 것.
대부분의 도구는 이 섹션을 숨깁니다. 우리는 이게 곧 제품이라고 생각합니다.
- 문제는 실재합니다. 토큰 비용은 멀티에이전트 시스템의 최상위 운영 통증이며, 낭비는 에이전트 안이 아니라 사이에 있습니다. (공개 시장 데이터, 출처 링크)
- 외부 증거 · 문제 실재. F1 0.72 · LangGraph 기반 주식시장 애플리케이션 한 곳의 트레이스 1,575건. hybrid 방식, 별개 구현 (arXiv:2511.10650).
- 실측 데이터에서의 의미 층 분리. 실측 프로브에서 정밀도는 구조 층에서 나왔습니다. 그 층의 동일성 판정은 sha256 일치입니다. 의미 층은 동일 주제 출력을 깔끔히 분리하지 못했습니다. 사람이 붙인 라벨 대비 정밀도는 0.826이며, 라벨과 어긋난 스팬이 모두 진짜 낭비라고 주장하지 않습니다. 우리는 이 결과를 숨기지 않고 공개했습니다.
- 실측 절감. 아직 프로덕션에서 1달러도 절감을 측정하지 못했습니다. 사용자 수, 후기 없음. 아직 없기 때문입니다.
오른쪽 항목이 왼쪽으로 옮겨질 때, 이곳에서 가장 먼저 읽으시게 됩니다.
낭비는 에이전트가 일한 시간을 따라갑니다.
입력 청구서에서 재전송이 차지하는 몫은 하나의 숫자가 아닙니다. 세션이 길어질수록 올라가고, 예외 없이 올라갑니다.
- 1-234.87%
- 3-564.53%
- 6-1077.67%
- 11+88.02%
네 번째 코퍼스에서만 측정했습니다. 우리가 수집하지 않은 Claude Code 세션 859건, 2026-08-30. 결과가 돌아온 호출만 셉니다. 나머지 세 코퍼스는 이 방식으로 재본 적이 없으므로, 이것은 한 코퍼스 안의 곡선이지 모든 코퍼스에 적용되는 법칙이 아닙니다.
오픈소스입니다. 신뢰 자체가 곧 제품이니까요.
Boxdawn은 MIT 라이선스이며 기본값은 결정론입니다. 네 개의 디텍터(repeat, context resend, redundant read, duplicate creation)가 로컬에서 실행됩니다. API 호출 없음, 가입 없음. 다섯 번째 층 semantic-duplicate LLM-judge는 opt-in 전용입니다: 기본 비활성이며, ANTHROPIC_API_KEY와 CLEW_ENABLE_LLM_JUDGE=1을 명시적으로 설정해야 활성화됩니다. 결정론 층은 같은 트레이스가 들어가면 매번 같은 리포트가 나옵니다.
$ pip install boxdawn$ boxdawn analyze your_trace.jsonOpenTelemetry SDK JSON과 OpenInference 트레이스 익스포트를 지원합니다: LangGraph, CrewAI, AutoGen, LlamaIndex. OTLP proto-JSON은 아직 지원하지 않습니다.
왜 시작했는가.
서버도, 네트워크도, 데이터베이스도 처음엔 닫혀 있었습니다. 열린 다음에야 그 위에 산업이 섰습니다. 에이전트만 아직 닫혀 있습니다.
IBM Research는 “에이전트, 그것을 움직이는 LLM, 연결된 도구 같은 구성요소들이 흔히 블랙박스로 기능한다”고 적었습니다(Formalizing Observability in Agentic AI Systems, AAAI 2026). 그 문장을 읽고 든 생각은 하나였습니다. 프로그램인데 왜 보지를 못 할까?
보이지 않는 것은 고칠 수도, 믿을 수도, 맡길 수도 없습니다. 기업이 AI 예산을 잠그는 이유는 못 믿어서가 아니라 안 보여서입니다. AI가 사람의 일을 대신하려면, 먼저 사람이 그 일을 볼 수 있어야 합니다.
비용에서 시작하는 이유는 하나입니다. 청구서가 블랙박스 밖으로 새어 나온 유일한 신호이기 때문입니다.
우리가 가려는 곳.
목표는 에이전트를 고용할 수 있게 만드는 것입니다.
사람을 고용할 때 우리는 그 사람이 뭘 했는지 볼 수 있다고 전제합니다. 보고, 평가하고, 틀리면 고치고, 못 미더우면 권한을 줄입니다. 사람이 회사 돈을 쓰면 영수증이 남고, 나중에 누가 왜 썼는지 물을 수 있습니다. 에이전트에게는 그중 아무것도 못 합니다. 그런데 우리는 그 에이전트에게 점점 더 큰 권한을 주고 있습니다.
AI가 사람의 일을 대신하려면 사람의 일이 받는 질문을 똑같이 받아야 합니다. 그 질문에 답할 수 있게 되는 날, 에이전트는 도구가 아니라 인력이 됩니다.
우리가 일하는 방식.
규율은 사전 등록입니다. 결과를 보기 전에 기준을 등록하고, 평가는 단 한 번만 실행하며, 부정적인 발견도 성공과 함께 공개합니다. 이 제품의 첫 버전은 자체 사전 등록 시험을 통과하지 못했습니다. 우리는 그것을 폐기하고, 공개적으로 밝히고, 그 위에서 이 버전을 만들었습니다.
프로덕션에서 멀티에이전트를 돌리고 계신가요? 여러분의 트레이스를 원합니다.
Boxdawn은 네 공개 벤치마크 코퍼스 총 17,881건 트레이스(Claude Code 세션 28건, Toolathlon 트래젝토리 6,780건, Exgentic 에이전트-LLM 트레이스 10,056건, 그리고 우리가 수집하지 않은 Claude Code 세션 1,017건)로 검증되었습니다. 다음 정직한 단계는 팀의 프로덕션 트레이스입니다. 그리고 그건 여러분에게 달려 있습니다. 실행 트레이스(OTel 또는 OpenInference JSON)를 보내주시면 Boxdawn에 통과시켜 정확히 무엇을 찾았는지 위양성까지 포함해 회신드립니다. 가입 없음, 아무것도 팔지 않습니다.
외부에 데이터를 공유할 수 없나요? 좋습니다. 그게 바로 local-first의 목적입니다. Boxdawn을 직접 실행하시고 숫자만 공유해주세요. 어느 쪽이든 여러분의 트레이스는 재보정에 직접 반영되며, 원하시면 공개적으로 크레딧을 남깁니다.