연구 현황 보고

System 1.5 — 검증 결과, 재설계 방향 및 진행 현황

2026년 7월 21일 · 작성 허상훈 · 대상: 지도교수님

근거 데이터: ConvFinQA 공식 dev 분할(봉인 관리), 예측 원본 JSONL 및 실행 로그 전량 보존

1요약

기존 DEQ 방식 (실측)
0%
7/14 · 논문 기재 64.9% 재현 불가
재구축 후 현재 (실측)
78.6%
7/17 · dev-A 210세션 · 실행 채점
기존 논문 목표 대비
+13.8%p
목표 64.8% 초과 (단, 방식 상이)
진행 중 실험 (G0)
9.2%
7/23 저녁 완료 예상
  1. 기존 논문의 핵심 수치(Full DEQ Solver 64.9%)는 재현되지 않음을 실측으로 확인했습니다. 원인은 사전학습 블록을 고정점 연산자로 사용한 구조적 오류이며, 구현 결함 7건과는 별개의 문제입니다.
  2. 검증 가능한 방식(토큰-CoT 지도학습 + 외부 실행기 채점)으로 재구축한 결과, held-out 평가에서 78.6%를 달성해 기존 목표치를 상회했습니다. 단, 이는 DEQ 반복 없이 얻은 기준선입니다.
  3. 반복 계산의 학술적 가치를 검증하기 위한 단계적 실험(G0 → G1)이 진행 중이며, 2주 내 조기 판정 기준(G1)에 따라 지속 여부를 결정합니다.

2경위 개요

구분내용
무엇을금융 문서 기반 수치 추론 AI(System 1.5)의 성능 검증 및 재구축
제출 전 자체 재현성 검증에서 논문 기재 수치가 재현되지 않음을 발견
언제7/13 검증 착수 → 7/14 원인 규명 → 7/15 방법 전환 → 7/17 목표 초과 → 현재 후속 실험
어디서연구실 GPU 서버(할당 원칙 준수), 공식 ConvFinQA/FinQA 데이터
어떻게결함 분해 수리 → 검증 가능한 구조로 재조립 → 매 단계 held-out 실측
누가허상훈 (AI 코딩 에이전트 파이프라인 활용, 독립 재현 절차 신설)

3문제 진단과 조치

증상원인조치상태
반복할수록 출력 붕괴 (동일 단어 반복)1회 순방향용으로 학습된 Gemma 블록을 고정점 반복에 사용 → 은닉 상태가 정상 범위의 약 70배로 발산반복 구조 폐기, 단일 순방향(T=1) 기준으로 전환구조 교체
핵심 기능(ΔW)이 성능에 무영향평가 시 ΔW 오버레이가 적용 경로에서 제거되는 결함 — 종전 모든 CFD 수치는 ΔW 없이 측정된 것결함 수정 완료수정
긴 문서에서 성능 급락토큰 절단 방향 오류로 질문 문장이 입력에서 삭제 (학습·평가 공통)절단 방향 수정(질문 보존)수정
수식은 맞고 답 숫자만 오답모델 내부 산술의 한계계산 프로그램만 생성, 산술은 외부 실행기 담당 (공식 FinQA 채점 방식) — +12.3%p개선
학습 효과 제한학습 범위가 마지막 6개 층 일부(전체의 0.05%)에 국한텍스트 디코더 전층 LoRA로 확대(34.9M 파라미터) — +20.4%p개선
보고 수치와 실측 괴리자동 생성 보고서의 목표 서술 및 대리 지표 혼용독립 재현 절차 신설: held-out + 예측 원본 보존 + 분할 봉인 + 다중 seed절차화

그 외 FWP 랭크 불일치, 중복 초기화, 수렴 임계값 부적정 등 구현 결함 총 7건 수정 완료. 상세는 부록의 진단 문서 참조.

4성과 추이

기존 방식 실측 재구축 단계별 현재 기존 논문 목표 64.8%
0% 50% 100% 기존 논문 목표 64.8% 0% 4% 58.2% 78.6% 7/14 기존 DEQ 실측 7/15 직접-답 학습 7/16 토큰-CoT (부분) 7/17 토큰-CoT (전층)
그림 1. 정확도 추이 (ConvFinQA held-out, 실행 채점 기준). 사흘간 0% → 78.6%
시점구성정확도변화 요인
7/14기존 DEQ 방식 공식 벤치마크0% (채점 가능 출력 0건)— (고장 확인, 출발점)
7/15답만 학습 (T=1)4%생성 정상화, 산술 한계 확인
7/16풀이과정 학습, 부분 범위58.2%계산 프로그램 학습 + 실행기 채점
7/17풀이과정 학습, 전층 범위78.6% (세부: anchor 75.2 / follow-up 79.9)학습 범위 18배 확대

측정 조건: dev-A 210세션·737턴(사전 봉인 분할), 단일 seed, 멀티턴 이력은 정답 조건(teacher-forced). 최종 보고 수치는 3-seed 평균±표준편차 및 봉인 셋(dev-B) 평가 후 확정 예정.

5세 가지 접근 방식 비교

단계적 전환: 물의 상태 변화(기체 → 액체 → 고체)에 대응하는 안정화 과정 ① 기존 DEQ 형태가 잡히지 않는 상태 반복할수록 표현 붕괴 실측 0% — 폐기 ② 토큰-CoT (현재) 안정된 중간 상태 풀이과정을 토큰으로 생성 실측 78.6% — 완성 ③ Thought-Slot DEQ 목표 결정형 전용 사고 슬롯만 T회 반복 G1 게이트 검증 예정 ②가 ③에 공급: 교사 신호 · 비교 기준선 · 검증된 부품 일체 ①→③ 직행 경로는 실패 시 원인 특정이 불가하여 기각
그림 2. 세 방식의 관계 — ②를 경유해야 ③의 성패를 해석할 수 있음

5.1 구조·작동 원리

① 기존 DEQ 폐기② 토큰-CoT 완성③ Thought-Slot DEQ 설계 완료
구조Gemma 42층 중 마지막 6층을 고정점 루프로 래핑Gemma 42층 표준 구조 + 전층 LoRA(34.9M)Gemma(고정) + 전용 사고 슬롯 32~64개 + 경량 반복 모듈
작동 원리은닉 상태를 동일 블록에 50~100회 재투입문서 독해 → 계산 프로그램을 토큰으로 생성 → 외부 실행기가 산술 수행문맥은 1회만 부호화(KV 고정) → 슬롯 상태만 T회 갱신 → 최종 슬롯이 프로그램 생성 → 실행기 산술
추론의 위치(의도) 반복 내부의 잠재 공간생성되는 풀이 토큰슬롯의 반복 갱신 (잠재 공간, 단 전용 설계 공간)
성패 원인1회 통과용으로 학습된 블록은 반복 시 학습 분포 이탈모델이 가장 잘하는 과업(다음 토큰 예측)에 추론을 위임슬롯을 처음부터 반복 안정적으로 학습 (CTS 프로젝트에서 검증된 원리 이식)
관문풀이 토큰 약 100개 생성 비용G1: 반복 횟수 증가가 정확도 향상으로 이어지는가

5.2 자원·성능 (✓ 실측 / ~ 추정)

① 기존 DEQ② 토큰-CoT③ Thought-Slot DEQ
정확도✓ 0%78.6%G1 판정 후 확정
문제당 응답 시간✓ 236초 (반복 100회 비용)✓ ~24초 (현 평가 하네스) / ~3~4초 (KV 캐시 적용 시)~1초대 목표 (프로그램 20토큰 + 슬롯 반복)
출력 길이— (붕괴)~100 토큰 (풀이+수식+답)~20 토큰 (수식만)
학습 시간무의미 (학습해도 0%)✓ 약 22시간 (2 epoch)~1~2주 (파일럿 커리큘럼)
학습 메모리✓ ~38GB✓ 35.7GB (활성값 체크포인팅 필수)~ 동급 (슬롯 추가분 미미)
세션 기억(ΔW)설계상 1.4MB, 실제 미작동미적용 (매 질의 전체 문맥 재독해)1.4MB — 최초로 유효 작동 가능

6단계적 검증의 논리 — ①에서 ③으로 직행하지 않는 이유

기체가 액체를 거쳐 고체가 되듯, ②는 ③에 도달하기 위한 필수 안정화 단계입니다. 학술적으로는 다음 네 가지 근거로 요약됩니다.

  1. 변인 통제(원인 분리). 7/14 시점의 0%에는 네 가지 잠재 원인(데이터 결함, 채점 결함, 백본 능력 부족, 반복 구조 결함)이 얽혀 있었습니다. ② 단계에서 앞의 세 변인을 각각 수정·검증했으므로(질문 절단 수정, 실행기 채점 도입, 78.6% 달성), 이후 ③이 실패하면 원인은 슬롯 반복 메커니즘 하나로 특정됩니다. ①→③ 직행 시 실패 원인을 영구히 특정할 수 없습니다.
  2. 교사 신호 확보. ③의 슬롯 학습은 "도달해야 할 정답 풀이 분포"를 필요로 하는 증류 학습입니다. 그 교사가 ② 모델입니다. ② 없이는 ③의 학습 신호 자체가 존재하지 않습니다.
  3. 비교 기준선 확보. ③의 성패는 "②의 78.6%를 더 적은 계산으로 재현(또는 초과)하는가"로 정의됩니다. 기존 논문이 무너진 근본 이유가 정직한 기준선의 부재였으므로, 동일한 실수를 구조적으로 차단합니다.
  4. 부품 재사용. 절단 수정, 실행기 채점, 분할 봉인, 전층 LoRA 백본 등 ②에서 검증된 부품 위에 ③은 슬롯 모듈 하나만 추가합니다. 미검증 부품의 동시 조립은 실패 확률을 곱셈으로 키웁니다.
진행 중인 G0 실험의 역할 — 간극의 정량화. ②에서 풀이 서술을 제거하고 수식만 생성하도록 학습한 변형(G0)의 정확도 낙폭은, ③의 슬롯 반복이 회수해야 할 계산량의 정확한 크기를 알려줍니다. 낙폭이 작으면 반복 없이도 3~5배 빠른 시스템이 확보되고(출력 100→20토큰), 낙폭이 크면 ③의 존재 가치가 정량적으로 입증됩니다. 어느 결과든 다음 단계의 근거가 되는 양방향 실험입니다.

7단기 논문 트랙 — 비교군(베이스라인) 재설계

단기 트랙을 "경량 ΔW 세션 메모리 + OOD 안전 라우팅 + 78.6% 정확도" 중심으로 재구성할 경우, 기존 논문 Table 2의 비교군은 전부 재사용이 불가능합니다. 기존 8개 행은 모두 "동일 DEQ 백본에 이식"이 전제였는데 그 기준계 자체가 소멸했고, 상당수는 구현 실체도 없었기 때문입니다. 따라서 단순 재실험이 아니라 새 주장에 맞는 비교군 재설계가 필요하며, 아래와 같이 확정했습니다.

7.1 기존 비교군 8개의 처리 방침

기존 Table 2 항목처리사유
Full DEQ Solver폐기DEQ 전용 개념. 새 기준은 "매 턴 전체 문맥 재독해(full re-encode)"가 대체
Warm-Start DEQ폐기솔버 상태 재사용 개념 자체가 소멸 (단, 상태-재사용 아이디어는 G4 게이트의 대조군으로 계승)
LayerSkip폐기"솔버 반복의 조기 중단" — 반복이 없는 프레임에서 무의미
HyperLoRA / Text-to-LoRA변형 유지 (선택)"질문에서 어댑터 생성(사전) vs 완료된 추론에서 생성(사후, 우리 FWP)" 대비는 새 프레임에서도 유효 — 단 CoT 백본 위 신규 구현 필요, 8월 초 진척 보고 후 채택 결정
InfLoRA / SD-LoRA관련연구 서술로 강등세션 적응 비교로는 유효하나 구현 비용 대비 기여 낮음
Semantic Entropy유지 (재실행)라우터 비교용 — 구현 존재, 새 백본에서 재측정만 필요

7.2 신규 Table 2 설계 — 세션 메모리 비교 (전 항목 동일 CoT 백본 위)

방법세션 기억 방식메모리/세션Follow-up 정확도상태
Full re-encode (상한 기준)없음 — 매 턴 전체 재독해0 (비용은 시간)79.9% (실측 완료)확보
KV-cache 유지 (표준 서빙)KV 텐서 보존~600MB상한과 동일 예상구현 0.5일
요약/절단 메모리 (경량 대안)텍스트 요약 보존~수 KB측정 필요구현 1일
No-memory (하한)없음 — 질문만 입력0측정 필요구현 수 시간
ΔW 세션 메모리 (제안)저랭크 가중치 오버레이1.4MB금주 실측 (핵심 실험)진행

이 표가 재구성 논문의 중심 결과가 됩니다 — "ΔW가 상한(79.9%)에 근접하면서 표준 KV 대비 약 425배의 메모리 절감을 실증하는가". OOD 비교표(구 Table 5)는 MSP·Energy(경량 구현)+Semantic Entropy+제안 라우터로 재구성합니다.

7.3 용어 정의 — "CoT 백본"이란

본 보고서의 "CoT 백본(78.6%)"은 새 모델이 아니라, 동일한 Gemma-4-E4B에 대한 학습·실행 방식의 조합을 가리킵니다. 기존 방식과의 차이는 모델이 아니라 "포장"에 있습니다.

구성 요소기존 DEQ 방식CoT 백본 (현재)
물리적 모델google/gemma-4-e4b (42층) — 완전히 동일
미세조정(LoRA)마지막 6층 일부, 1.9M 파라미터 (손상된 학습)텍스트 디코더 전층, 34.9M 파라미터 (신규 학습)
마지막 6층의 취급고정점 루프로 래핑 + 출력 억제표준 1회 통과 (원 설계 그대로)
결과0%78.6%

같은 엔진을 두고, 기존 방식은 엔진을 개조하다 손상시켰고, 현재 방식은 엔진을 원 설계대로 사용하며 과업 학습만 새로 수행한 것입니다. 향후 Thought-Slot DEQ(3단계)도 동일한 Gemma-4-E4B 위에서 진행되므로 세 방식 간 비교의 공정성이 성립합니다.

7.4 Thought-Slot DEQ 성공 시(G1–G4 통과) 비교군의 처리 — "무대 고정, 개념의 계승"

중요한 설계 원칙: G1–G4가 성공하더라도 기존 "DEQ 백본"으로 되돌아가는 일은 발생하지 않습니다. Thought-Slot DEQ는 백본이 아니라 CoT 백본 위에 추가되는 모듈이며, 비교의 무대는 어떤 시나리오에서도 CoT 백본으로 고정됩니다. 기존 DEQ 백본은 작동한 적이 없으므로 복귀 대상 자체가 존재하지 않습니다. 비교군은 백본이 아니라 주장(claim)에 귀속되므로, 성공 시에는 새 주장에 대응하는 비교가 같은 무대 위에 추가될 뿐입니다. 이때 폐기된 개념 일부는 형태를 바꿔 계승됩니다.

기존 개념순수 CoT 논문에서Thought-Slot 성공 시 — 계승 형태
Full DEQ Solver폐기제안 방법의 "최대 반복 설정(T=16)"이 그 역할 수행 — 비교군이 아닌 상한 참조점
Warm-Start DEQ폐기계승 — G4 게이트의 대조군 "슬롯 warm-start"로 설계에 기내장
LayerSkip (조기 종료)폐기계승 — "슬롯 반복의 적응적 종료"로 부활하되, 비교군이 아닌 제안 방법의 ablation
HyperLoRA / Text-to-LoRA변형 유지 검토동일 (사전 생성 대 사후 생성 대비 — 성공 여부와 무관)
신규 Table 2 (세션 메모리)중심 결과변경 없음 — ΔW 행의 실측치만 채워짐
요약. 폐기된 것은 비교군의 "개념"이 아니라 작동하지 않았던 "무대(DEQ 백본)"입니다. 성공 시 유효한 개념들은 새 무대 위에서 대조군·ablation으로 계승되며, 재실험은 새 무대에서 1회뿐 — 기존 무대에서의 재실험은 어떤 경로에서도 발생하지 않습니다. 따라서 현재 진행 중인 신규 Table 2와 G0–G4 실험은 Thought-Slot의 성패와 무관하게 전량 최종 논문에 사용되는, 경로 독립적 설계입니다.

8진행 현황 및 일정

8.1 현재 실행 중 (2026-07-21 15:41 기준)

작업G0: 수식 전용 지도학습 (GPU 3, 전층 LoRA 34.9M)
진행률step 1,600 / 17,356 (epoch 0의 약 9.2%) · 약 5.6초/step
학습 상태손실(CE) 최근 평균 ~0.094 — 정상 수렴
완료 예상7/23(수) 저녁 (잔여 약 51시간) → 완료 즉시 동일 하네스로 실행 채점

8.2 향후 일정

기간작업판정 게이트
7/23–7/24G0 평가 — 토큰-CoT 78.6% 대비 낙폭 측정G0
7월 4주–8월 1주Thought-Slot 파일럿 학습·평가 / 병행: FWP·ΔW 세션 기억 실측(신규 Table 2), 라우터 재검증G1 (지속 여부 조기 판정)
8월 2–4주G1 통과 시: 반복 규모·적응적 종료 실험 / 미통과 시: 세션 메모리 중심 논문으로 확정. 신규 비교군 4종 실측 완료G2·G3·G4
9월 1–2주3-seed 최종 실측, 봉인 셋(dev-B) 평가, 초고·저장소 정리

9논의 요청 사항

  1. 단기 논문 트랙을 "경량 ΔW 세션 메모리 + OOD 안전 라우팅 + 78.6% 정확도" 중심으로 확정하는 방안
  2. Thought-Slot DEQ는 G1 게이트(약 2주)까지 제한 실험 후 지속 여부를 결정하는 방안
  3. 결과 공유 범위(공동연구자·연구실 내부)와 저장소 정리 일정

10부록 — 근거 자료 (원문 열람)

아래 각 항목을 클릭하면 해당 파일의 실제 내용이 펼쳐집니다. 로컬 원본 경로: D:\AI\System1.5 - Claude\ 하위의 logs/, doc/, data/official_convfinqa/

① 최종 채점 결과 rescore_devA_full.json — 78.6%의 원본 산출물 (전문)
{
  "n": 737,
  "model_answer_acc": 0.6580732700135685,
  "executed_program_acc": 0.7856173677069199,
  "exec_coverage": 0.6037991858887382,
  "anchor": {
    "n": 210,
    "base": 0.6857142857142857,
    "exec": 0.7523809523809524
  },
  "followup": {
    "n": 527,
    "base": 0.6470588235294118,
    "exec": 0.7988614800759013
  }
}
② 평가 요약 eval_devA_full.json — 모델 자체 산술 기준 65.8% (전문)
{
  "sft_ckpt": "./checkpoints/sft_cot_full/sft_cot_epoch_1.pt",
  "n_sessions": 210,
  "anchor_acc": 0.6857142857142857,
  "followup_acc": 0.6470588235294118,
  "overall_acc": 0.6580732700135685,
  "n_anchor": 210,
  "n_followup": 527
}
③ 예측 원본 devA_full_preds.jsonl — 737턴 전량 보존 · 737건
총 737건의 생성 원본 중 앞 6건 표시

[세션 Single_IPG/2009/page_85.pdf-3 · 턴 0] 채점=오답
  정답: 0.10826
  모델 출력:  We compute: divide(3.8, 35.1) = 0.10811. The final answer is 0.10811

[세션 Single_IPG/2009/page_85.pdf-3 · 턴 1] 채점=정답
  정답: 10.82621
  모델 출력:  We compute: divide(3.8, 35.1), multiply(#0, const_100) = 10.82593. The final answer is 10.82593

[세션 Single_DVN/2007/page_58.pdf-3 · 턴 0] 채점=오답
  정답: 0.24691
  모델 출력:  We compute: divide(60, 243) = 0.24605. The final answer is 0.24605

[세션 Single_DVN/2007/page_58.pdf-3 · 턴 1] 채점=정답
  정답: 24.69136
  모델 출력:  We compute: divide(60, 243), multiply(#0, const_100) = 24.69136. The final answer is 24.69136

[세션 Single_CDNS/2018/page_31.pdf-1 · 턴 0] 채점=오답
  정답: 18.77
  모델 출력:  We compute: subtract(109.54, 110.28) = -0.74. The final answer is -0.74

[세션 Single_CDNS/2018/page_31.pdf-1 · 턴 1] 채점=정답
  정답: 1000.0
  모델 출력:  We compute: divide(100000, 100) = 1000.0. The final answer is 1000.0
④ 분할 봉인 매니페스트 DEV_SPLIT_MANIFEST.json — dev-A 210 / dev-B 211 · SHA-256 고정
{
  "created": "2026-07-16",
  "source": "data\\official_convfinqa\\dev.json",
  "source_sha256": "9665dd60f106e5cd41d37537edac97bbd26eb7629ad63ca2390b19d4619ba51b",
  "seed": 20260716,
  "dev_A_gate": [
    "Double_AAP/2011/page_28.pdf",
    "Double_ABMD/2009/page_88.pdf",
    "Double_ADBE/2018/page_86.pdf",
    "Double_AES/2015/page_117.pdf",
    "Double_AMAT/2013/page_18.pdf",
    "Double_AMT/2005/page_85.pdf",
    "Double_AMT/2008/page_32.pdf",
    "Double_AMT/2012/page_125.pdf",
    "... 외 202건"
  ],
  "dev_B_sealed": [
    "Double_ABMD/2006/page_75.pdf",
    "Double_ADI/2011/page_81.pdf",
    "Double_AES/2002/page_46.pdf",
    "Double_AES/2016/page_185.pdf",
    "Double_AES/2016/page_191.pdf",
    "Double_AES/2017/page_157.pdf",
    "Double_AMAT/2014/page_18.pdf",
    "Double_AMT/2004/page_81.pdf",
    "... 외 203건"
  ],
  "rule": "Gates (G0-G4) use dev_A only. dev_B is sealed until final multi-seed eval. Never tune to either after seeing results."
}

PDF 저장: 브라우저 인쇄(Ctrl/Cmd+P) → "PDF로 저장"을 이용하시면 인쇄 최적화된 문서로 내려받을 수 있습니다.