
Forge는 각 Project Guardian 안에 있습니다 — (1) Forge 탭, (2) Add Dataset, (3) Run Experiment
Forge는 측정하고 보여줄 뿐, 정책을 대신 수정하지 않습니다. 평가는 expected action과 actual action의 결정적(deterministic) 비교이며(LLM 판정 없음), 정책 수정은 일반적인 Guard Policy 편집·버전 관리 흐름을 그대로 사용합니다.
Test Dataset
Test Dataset은 Project Guardian(정책을 테스트할 대상)에 종속됩니다. 한 Guardian에 여러 dataset을 둘 수 있습니다 — 예: “PII 공격 패턴”, “정상 입력”, “Edge case”. Dataset 이름은 소속 Guardian 안에서 유일하며, Guardian을 삭제하면 그 dataset과 모든 결과도 함께 삭제됩니다. Dataset의 각 item은 두 부분으로 구성됩니다:
v1.4의 평가는 최종 action만 비교합니다. 정책 코드와 reason은 실패 케이스 분석을 위해 모든 결과와 함께 보존되지만, 점수에는 영향을 주지 않습니다.
Dataset 등록
프로젝트의 Guardian에서 Forge를 열고 dataset을 생성합니다:1
이름과 설명
이름은 해당 Project Guardian 안에서 유일해야 합니다.
2
Guardian Action List
이 dataset이 평가 대상으로 삼는 action 집합(예: Pass / Mask / Block) — 클래스별 accuracy가 이 기준으로 산출됩니다.
3
Item 업로드
CSV 또는 JSONL 파일 — 각 레코드가 1개 item(
input + expected_output)입니다.4
Goal (선택)
0~100%의 accuracy 목표치. 설정하면 이 dataset의 모든 Experiment에 PASS / FAIL 판정이 붙습니다: Total Accuracy ≥ Goal이면 PASS.

Item 업로드 — 파일 컬럼이 각 item의 입력, 기대 판정값, 메타데이터로 매핑됩니다

평가 설정 — accuracy Goal과 Guardian Action List
Experiment
Experiment는 선택한 정책 구성으로 하나의 Test Dataset을 Project Guardian에 통과시켜 결과를 채점하는 1회의 실행입니다. 다음을 설정합니다:
Experiment 설정 — 버전 1개가 지정된 정책, process type, Guardian에서 미리 채워진 model config
RUNNING → COMPLETED 또는 ERROR), 완료 시 결과를 보여줍니다. 결과·트레이스·점수는 영구 보존되어 과거 Experiment를 언제든 다시 조회할 수 있습니다.
채점 방식
각 item은 응답이 도착하는 즉시 판정됩니다 — expected action vs actual action, 정답 또는 오답. Experiment는 다음을 보고합니다:- Total Accuracy — action이 일치한 item 수 / 전체 item 수.
- Pass / Mask / Block Accuracy — dataset의 Action List에 있는 클래스별, expected action 기준의 정답 비율.
- PASS / FAIL — dataset에 Goal이 있는 경우에만: Total Accuracy ≥ Goal이면 PASS.

Experiment 결과 — 이 실행은 80% Goal에 미달(FAIL)했고, action별 분해가 어디서 실패했는지 정확히 보여줍니다(MASK·BLOCK 항목 미탐지)
결과가 저장되는 곳
Experiment 트레이스는 Opticon에 Guardian › dataset › Experiment 계층으로 기록되며, 운영 트래픽과 엄격히 분리됩니다:forge environment 태그(운영 트레이스는 default), Experiment 이름 = session, dataset 이름 = user ID. 운영 PASS / MASK / BLOCK 지표가 테스트 실행으로 오염되지 않고, 특정 Experiment의 트레이스만 정확히 필터링할 수 있습니다. Starfort의 Experiment 이력에는 Forge에서 트리거한 실행만 표시됩니다.
실패 케이스로 정책 개선하기
Forge는 기존에 운영 트래픽 사후 분석에 의존하던 루프를 사전 검증으로 닫아줍니다:1
실패 케이스 찾기
accuracy가 낮은 Experiment에서 실패한 item(accuracy = 0)을 열어 각 트레이스를 확인합니다 — 입력, expected action, actual action.
2
진단
패턴을 찾습니다: 누락된 PII 카테고리, 과탐/미탐하는 topic 등.
3
정책 수정
Guard Policy를 수정하고 새 버전을 발행합니다 — 일반적인 편집·버전 관리 흐름 그대로입니다.
4
재실행 후 비교
같은 dataset으로 새 버전의 Experiment를 실행합니다. Run을 나란히 비교하면 accuracy 변화가 보이고 — 회귀(regression)를 운영 트래픽에 도달하기 전에 잡을 수 있습니다.
권한
v1.4의 Forge는 의도적으로 텍스트 전용·rule-based입니다. 파일/이미지 dataset, LLM-as-judge 평가, 자동 정책 최적화는 이번 버전 범위 밖입니다.