근거 데이터: ConvFinQA 공식 dev 분할(봉인 관리), 예측 원본 JSONL 및 실행 로그 전량 보존
1요약
기존 DEQ 방식 (실측)
0%
7/14 · 논문 기재 64.9% 재현 불가
재구축 후 현재 (실측)
78.6%
7/17 · dev-A 210세션 · 실행 채점
기존 논문 목표 대비
+13.8%p
목표 64.8% 초과 (단, 방식 상이)
진행 중 실험 (G0)
9.2%
7/23 저녁 완료 예상
기존 논문의 핵심 수치(Full DEQ Solver 64.9%)는 재현되지 않음을 실측으로 확인했습니다. 원인은 사전학습 블록을 고정점 연산자로 사용한 구조적 오류이며, 구현 결함 7건과는 별개의 문제입니다.
검증 가능한 방식(토큰-CoT 지도학습 + 외부 실행기 채점)으로 재구축한 결과, held-out 평가에서 78.6%를 달성해 기존 목표치를 상회했습니다. 단, 이는 DEQ 반복 없이 얻은 기준선입니다.
반복 계산의 학술적 가치를 검증하기 위한 단계적 실험(G0 → G1)이 진행 중이며, 2주 내 조기 판정 기준(G1)에 따라 지속 여부를 결정합니다.
2경위 개요
구분
내용
무엇을
금융 문서 기반 수치 추론 AI(System 1.5)의 성능 검증 및 재구축
왜
제출 전 자체 재현성 검증에서 논문 기재 수치가 재현되지 않음을 발견
언제
7/13 검증 착수 → 7/14 원인 규명 → 7/15 방법 전환 → 7/17 목표 초과 → 현재 후속 실험
어디서
연구실 GPU 서버(할당 원칙 준수), 공식 ConvFinQA/FinQA 데이터
어떻게
결함 분해 수리 → 검증 가능한 구조로 재조립 → 매 단계 held-out 실측
누가
허상훈 (AI 코딩 에이전트 파이프라인 활용, 독립 재현 절차 신설)
3문제 진단과 조치
증상
원인
조치
상태
반복할수록 출력 붕괴 (동일 단어 반복)
1회 순방향용으로 학습된 Gemma 블록을 고정점 반복에 사용 → 은닉 상태가 정상 범위의 약 70배로 발산
반복 구조 폐기, 단일 순방향(T=1) 기준으로 전환
구조 교체
핵심 기능(ΔW)이 성능에 무영향
평가 시 ΔW 오버레이가 적용 경로에서 제거되는 결함 — 종전 모든 CFD 수치는 ΔW 없이 측정된 것
결함 수정 완료
수정
긴 문서에서 성능 급락
토큰 절단 방향 오류로 질문 문장이 입력에서 삭제 (학습·평가 공통)
절단 방향 수정(질문 보존)
수정
수식은 맞고 답 숫자만 오답
모델 내부 산술의 한계
계산 프로그램만 생성, 산술은 외부 실행기 담당 (공식 FinQA 채점 방식) — +12.3%p
개선
학습 효과 제한
학습 범위가 마지막 6개 층 일부(전체의 0.05%)에 국한
텍스트 디코더 전층 LoRA로 확대(34.9M 파라미터) — +20.4%p
개선
보고 수치와 실측 괴리
자동 생성 보고서의 목표 서술 및 대리 지표 혼용
독립 재현 절차 신설: held-out + 예측 원본 보존 + 분할 봉인 + 다중 seed
절차화
그 외 FWP 랭크 불일치, 중복 초기화, 수렴 임계값 부적정 등 구현 결함 총 7건 수정 완료. 상세는 부록의 진단 문서 참조.
4성과 추이
기존 방식 실측재구축 단계별현재기존 논문 목표 64.8%
그림 1. 정확도 추이 (ConvFinQA held-out, 실행 채점 기준). 사흘간 0% → 78.6%
시점
구성
정확도
변화 요인
7/14
기존 DEQ 방식 공식 벤치마크
0% (채점 가능 출력 0건)
— (고장 확인, 출발점)
7/15
답만 학습 (T=1)
4%
생성 정상화, 산술 한계 확인
7/16
풀이과정 학습, 부분 범위
58.2%
계산 프로그램 학습 + 실행기 채점
7/17
풀이과정 학습, 전층 범위
78.6% (세부: anchor 75.2 / follow-up 79.9)
학습 범위 18배 확대
측정 조건: dev-A 210세션·737턴(사전 봉인 분할), 단일 seed, 멀티턴 이력은 정답 조건(teacher-forced). 최종 보고 수치는 3-seed 평균±표준편차 및 봉인 셋(dev-B) 평가 후 확정 예정.
5세 가지 접근 방식 비교
그림 2. 세 방식의 관계 — ②를 경유해야 ③의 성패를 해석할 수 있음
5.1 구조·작동 원리
① 기존 DEQ 폐기
② 토큰-CoT 완성
③ Thought-Slot DEQ 설계 완료
구조
Gemma 42층 중 마지막 6층을 고정점 루프로 래핑
Gemma 42층 표준 구조 + 전층 LoRA(34.9M)
Gemma(고정) + 전용 사고 슬롯 32~64개 + 경량 반복 모듈
작동 원리
은닉 상태를 동일 블록에 50~100회 재투입
문서 독해 → 계산 프로그램을 토큰으로 생성 → 외부 실행기가 산술 수행
문맥은 1회만 부호화(KV 고정) → 슬롯 상태만 T회 갱신 → 최종 슬롯이 프로그램 생성 → 실행기 산술
추론의 위치
(의도) 반복 내부의 잠재 공간
생성되는 풀이 토큰
슬롯의 반복 갱신 (잠재 공간, 단 전용 설계 공간)
성패 원인
1회 통과용으로 학습된 블록은 반복 시 학습 분포 이탈
모델이 가장 잘하는 과업(다음 토큰 예측)에 추론을 위임
슬롯을 처음부터 반복 안정적으로 학습 (CTS 프로젝트에서 검증된 원리 이식)
관문
—
풀이 토큰 약 100개 생성 비용
G1: 반복 횟수 증가가 정확도 향상으로 이어지는가
5.2 자원·성능 (✓ 실측 / ~ 추정)
① 기존 DEQ
② 토큰-CoT
③ Thought-Slot DEQ
정확도
✓ 0%
✓ 78.6%
G1 판정 후 확정
문제당 응답 시간
✓ 236초 (반복 100회 비용)
✓ ~24초 (현 평가 하네스) / ~3~4초 (KV 캐시 적용 시)
~1초대 목표 (프로그램 20토큰 + 슬롯 반복)
출력 길이
— (붕괴)
~100 토큰 (풀이+수식+답)
~20 토큰 (수식만)
학습 시간
무의미 (학습해도 0%)
✓ 약 22시간 (2 epoch)
~1~2주 (파일럿 커리큘럼)
학습 메모리
✓ ~38GB
✓ 35.7GB (활성값 체크포인팅 필수)
~ 동급 (슬롯 추가분 미미)
세션 기억(ΔW)
설계상 1.4MB, 실제 미작동
미적용 (매 질의 전체 문맥 재독해)
1.4MB — 최초로 유효 작동 가능
6단계적 검증의 논리 — ①에서 ③으로 직행하지 않는 이유
기체가 액체를 거쳐 고체가 되듯, ②는 ③에 도달하기 위한 필수 안정화 단계입니다. 학술적으로는 다음 네 가지 근거로 요약됩니다.
변인 통제(원인 분리). 7/14 시점의 0%에는 네 가지 잠재 원인(데이터 결함, 채점 결함, 백본 능력 부족, 반복 구조 결함)이 얽혀 있었습니다. ② 단계에서 앞의 세 변인을 각각 수정·검증했으므로(질문 절단 수정, 실행기 채점 도입, 78.6% 달성), 이후 ③이 실패하면 원인은 슬롯 반복 메커니즘 하나로 특정됩니다. ①→③ 직행 시 실패 원인을 영구히 특정할 수 없습니다.
교사 신호 확보. ③의 슬롯 학습은 "도달해야 할 정답 풀이 분포"를 필요로 하는 증류 학습입니다. 그 교사가 ② 모델입니다. ② 없이는 ③의 학습 신호 자체가 존재하지 않습니다.
비교 기준선 확보. ③의 성패는 "②의 78.6%를 더 적은 계산으로 재현(또는 초과)하는가"로 정의됩니다. 기존 논문이 무너진 근본 이유가 정직한 기준선의 부재였으므로, 동일한 실수를 구조적으로 차단합니다.
부품 재사용. 절단 수정, 실행기 채점, 분할 봉인, 전층 LoRA 백본 등 ②에서 검증된 부품 위에 ③은 슬롯 모듈 하나만 추가합니다. 미검증 부품의 동시 조립은 실패 확률을 곱셈으로 키웁니다.
진행 중인 G0 실험의 역할 — 간극의 정량화. ②에서 풀이 서술을 제거하고 수식만 생성하도록 학습한 변형(G0)의 정확도 낙폭은, ③의 슬롯 반복이 회수해야 할 계산량의 정확한 크기를 알려줍니다. 낙폭이 작으면 반복 없이도 3~5배 빠른 시스템이 확보되고(출력 100→20토큰), 낙폭이 크면 ③의 존재 가치가 정량적으로 입증됩니다. 어느 결과든 다음 단계의 근거가 되는 양방향 실험입니다.
7단기 논문 트랙 — 비교군(베이스라인) 재설계
단기 트랙을 "경량 ΔW 세션 메모리 + OOD 안전 라우팅 + 78.6% 정확도" 중심으로 재구성할 경우, 기존 논문 Table 2의 비교군은 전부 재사용이 불가능합니다. 기존 8개 행은 모두 "동일 DEQ 백본에 이식"이 전제였는데 그 기준계 자체가 소멸했고, 상당수는 구현 실체도 없었기 때문입니다. 따라서 단순 재실험이 아니라 새 주장에 맞는 비교군 재설계가 필요하며, 아래와 같이 확정했습니다.
7.1 기존 비교군 8개의 처리 방침
기존 Table 2 항목
처리
사유
Full DEQ Solver
폐기
DEQ 전용 개념. 새 기준은 "매 턴 전체 문맥 재독해(full re-encode)"가 대체
Warm-Start DEQ
폐기
솔버 상태 재사용 개념 자체가 소멸 (단, 상태-재사용 아이디어는 G4 게이트의 대조군으로 계승)
LayerSkip
폐기
"솔버 반복의 조기 중단" — 반복이 없는 프레임에서 무의미
HyperLoRA / Text-to-LoRA
변형 유지 (선택)
"질문에서 어댑터 생성(사전) vs 완료된 추론에서 생성(사후, 우리 FWP)" 대비는 새 프레임에서도 유효 — 단 CoT 백본 위 신규 구현 필요, 8월 초 진척 보고 후 채택 결정
InfLoRA / SD-LoRA
관련연구 서술로 강등
세션 적응 비교로는 유효하나 구현 비용 대비 기여 낮음
Semantic Entropy
유지 (재실행)
라우터 비교용 — 구현 존재, 새 백본에서 재측정만 필요
7.2 신규 Table 2 설계 — 세션 메모리 비교 (전 항목 동일 CoT 백본 위)
방법
세션 기억 방식
메모리/세션
Follow-up 정확도
상태
Full re-encode (상한 기준)
없음 — 매 턴 전체 재독해
0 (비용은 시간)
✓ 79.9% (실측 완료)
확보
KV-cache 유지 (표준 서빙)
KV 텐서 보존
~600MB
상한과 동일 예상
구현 0.5일
요약/절단 메모리 (경량 대안)
텍스트 요약 보존
~수 KB
측정 필요
구현 1일
No-memory (하한)
없음 — 질문만 입력
0
측정 필요
구현 수 시간
ΔW 세션 메모리 (제안)
저랭크 가중치 오버레이
1.4MB
금주 실측 (핵심 실험)
진행
이 표가 재구성 논문의 중심 결과가 됩니다 — "ΔW가 상한(79.9%)에 근접하면서 표준 KV 대비 약 425배의 메모리 절감을 실증하는가". OOD 비교표(구 Table 5)는 MSP·Energy(경량 구현)+Semantic Entropy+제안 라우터로 재구성합니다.
7.3 용어 정의 — "CoT 백본"이란
본 보고서의 "CoT 백본(78.6%)"은 새 모델이 아니라, 동일한 Gemma-4-E4B에 대한 학습·실행 방식의 조합을 가리킵니다. 기존 방식과의 차이는 모델이 아니라 "포장"에 있습니다.
구성 요소
기존 DEQ 방식
CoT 백본 (현재)
물리적 모델
google/gemma-4-e4b (42층) — 완전히 동일
미세조정(LoRA)
마지막 6층 일부, 1.9M 파라미터 (손상된 학습)
텍스트 디코더 전층, 34.9M 파라미터 (신규 학습)
마지막 6층의 취급
고정점 루프로 래핑 + 출력 억제
표준 1회 통과 (원 설계 그대로)
결과
0%
78.6%
같은 엔진을 두고, 기존 방식은 엔진을 개조하다 손상시켰고, 현재 방식은 엔진을 원 설계대로 사용하며 과업 학습만 새로 수행한 것입니다. 향후 Thought-Slot DEQ(3단계)도 동일한 Gemma-4-E4B 위에서 진행되므로 세 방식 간 비교의 공정성이 성립합니다.
7.4 Thought-Slot DEQ 성공 시(G1–G4 통과) 비교군의 처리 — "무대 고정, 개념의 계승"
중요한 설계 원칙: G1–G4가 성공하더라도 기존 "DEQ 백본"으로 되돌아가는 일은 발생하지 않습니다. Thought-Slot DEQ는 백본이 아니라 CoT 백본 위에 추가되는 모듈이며, 비교의 무대는 어떤 시나리오에서도 CoT 백본으로 고정됩니다. 기존 DEQ 백본은 작동한 적이 없으므로 복귀 대상 자체가 존재하지 않습니다. 비교군은 백본이 아니라 주장(claim)에 귀속되므로, 성공 시에는 새 주장에 대응하는 비교가 같은 무대 위에 추가될 뿐입니다. 이때 폐기된 개념 일부는 형태를 바꿔 계승됩니다.
기존 개념
순수 CoT 논문에서
Thought-Slot 성공 시 — 계승 형태
Full DEQ Solver
폐기
제안 방법의 "최대 반복 설정(T=16)"이 그 역할 수행 — 비교군이 아닌 상한 참조점
Warm-Start DEQ
폐기
계승 — G4 게이트의 대조군 "슬롯 warm-start"로 설계에 기내장
LayerSkip (조기 종료)
폐기
계승 — "슬롯 반복의 적응적 종료"로 부활하되, 비교군이 아닌 제안 방법의 ablation
HyperLoRA / Text-to-LoRA
변형 유지 검토
동일 (사전 생성 대 사후 생성 대비 — 성공 여부와 무관)
신규 Table 2 (세션 메모리)
중심 결과
변경 없음 — ΔW 행의 실측치만 채워짐
요약. 폐기된 것은 비교군의 "개념"이 아니라 작동하지 않았던 "무대(DEQ 백본)"입니다. 성공 시 유효한 개념들은 새 무대 위에서 대조군·ablation으로 계승되며, 재실험은 새 무대에서 1회뿐 — 기존 무대에서의 재실험은 어떤 경로에서도 발생하지 않습니다. 따라서 현재 진행 중인 신규 Table 2와 G0–G4 실험은 Thought-Slot의 성패와 무관하게 전량 최종 논문에 사용되는, 경로 독립적 설계입니다.
8진행 현황 및 일정
8.1 현재 실행 중 (2026-07-21 15:41 기준)
작업
G0: 수식 전용 지도학습 (GPU 3, 전층 LoRA 34.9M)
진행률
step 1,600 / 17,356 (epoch 0의 약 9.2%) · 약 5.6초/step
총 737건의 생성 원본 중 앞 6건 표시
[세션 Single_IPG/2009/page_85.pdf-3 · 턴 0] 채점=오답
정답: 0.10826
모델 출력: We compute: divide(3.8, 35.1) = 0.10811. The final answer is 0.10811
[세션 Single_IPG/2009/page_85.pdf-3 · 턴 1] 채점=정답
정답: 10.82621
모델 출력: We compute: divide(3.8, 35.1), multiply(#0, const_100) = 10.82593. The final answer is 10.82593
[세션 Single_DVN/2007/page_58.pdf-3 · 턴 0] 채점=오답
정답: 0.24691
모델 출력: We compute: divide(60, 243) = 0.24605. The final answer is 0.24605
[세션 Single_DVN/2007/page_58.pdf-3 · 턴 1] 채점=정답
정답: 24.69136
모델 출력: We compute: divide(60, 243), multiply(#0, const_100) = 24.69136. The final answer is 24.69136
[세션 Single_CDNS/2018/page_31.pdf-1 · 턴 0] 채점=오답
정답: 18.77
모델 출력: We compute: subtract(109.54, 110.28) = -0.74. The final answer is -0.74
[세션 Single_CDNS/2018/page_31.pdf-1 · 턴 1] 채점=정답
정답: 1000.0
모델 출력: We compute: divide(100000, 100) = 1000.0. The final answer is 1000.0
④ 분할 봉인 매니페스트 DEV_SPLIT_MANIFEST.json — dev-A 210 / dev-B 211 · SHA-256 고정
{
"created": "2026-07-16",
"source": "data\\official_convfinqa\\dev.json",
"source_sha256": "9665dd60f106e5cd41d37537edac97bbd26eb7629ad63ca2390b19d4619ba51b",
"seed": 20260716,
"dev_A_gate": [
"Double_AAP/2011/page_28.pdf",
"Double_ABMD/2009/page_88.pdf",
"Double_ADBE/2018/page_86.pdf",
"Double_AES/2015/page_117.pdf",
"Double_AMAT/2013/page_18.pdf",
"Double_AMT/2005/page_85.pdf",
"Double_AMT/2008/page_32.pdf",
"Double_AMT/2012/page_125.pdf",
"... 외 202건"
],
"dev_B_sealed": [
"Double_ABMD/2006/page_75.pdf",
"Double_ADI/2011/page_81.pdf",
"Double_AES/2002/page_46.pdf",
"Double_AES/2016/page_185.pdf",
"Double_AES/2016/page_191.pdf",
"Double_AES/2017/page_157.pdf",
"Double_AMAT/2014/page_18.pdf",
"Double_AMT/2004/page_81.pdf",
"... 외 203건"
],
"rule": "Gates (G0-G4) use dev_A only. dev_B is sealed until final multi-seed eval. Never tune to either after seeing results."
}
주요 수치 산출 조건: dev-A 210세션/737턴, 단일 seed, teacher-forced 이력, 실행 채점(공식 FinQA 방식). 78.6%는 executed_program_acc, 모델 자체 산술 기준은 65.8%.
PDF 저장: 브라우저 인쇄(Ctrl/Cmd+P) → "PDF로 저장"을 이용하시면 인쇄 최적화된 문서로 내려받을 수 있습니다.