개발 이유
첨삭이 부족해서가 아니라, 기준이 없어서 생긴 문제입니다.
국내 IELTS·TOEFL Writing 첨삭은 강사 개인의 경험에 크게 기대고 있습니다. 문제는 성의가 아니라 구조입니다.
채점자 편차
공식 채점기준을 체화하는 데는 시간이 걸립니다. 기준이 다르면 같은 답안에 다른 피드백이 나오고, 학습자는 무엇을 믿어야 할지 알 수 없습니다.
처리량의 물리적 한계
한 사람이 한 시간에 꼼꼼히 볼 수 있는 답안은 두세 편입니다. 성수기에는 대기가 생기고, 학원은 강사를 더 뽑아야 확장됩니다.
원인까지 가지 않는 피드백
오류의 정오 표시에 그치면, 그 오류가 표층 실수인지 과제 이해 부족인지 구분되지 않습니다. 같은 실수가 반복되는 이유입니다.
쌓이지 않는 학습 이력
응시와 첨삭이 기록으로 남지 않으면 진전도를 숫자로 볼 수 없고, 학원도 위험한 학생을 미리 알아볼 수 없습니다.
그래서 채점·진단·원인분석·처방·재검증을 하나의 파이프라인으로 묶었습니다. 사람을 대신하려는 것이 아니라, 사람이 반복하기 어려운 일을 기계가 맡는 구조입니다.
연구개발 과제
다섯 개 엔진으로 진단에서 처방까지 잇습니다.
현재 서비스는 Claude 기반 자동 채점으로 동작합니다. 아래 다섯 모듈은 이 파이프라인을 고도화하기 위한 연구개발 과제이며, 아직 구현된 성능이 아닙니다.
공식 채점기준을 근거로 한 Claude 기반 자동 채점 · 문장 단위 진단 · 맞춤 처방 생성
- M1개발 목표
멀티모달 답안 구조 인식
손글씨 답안지에서 문단·문장·구조 요소를 추출해 정량 지표로 바꿉니다.
- 적용 모델
- SAM2 · RT-DETR · DINOv2 · TrOCR
- 입력
- 손글씨 스캔 이미지 또는 타이핑 원고, 시험 유형
- 출력
- 문단별 구조 태그, 문장 경계, 구조 완성도 점수, 정제 텍스트
- M2개발 목표
정밀 진단·이상탐지
고득점 답안 분포에서 벗어난 구간을 찾아 위치를 특정하고 점수를 보정합니다.
- 적용 모델
- PatchCore · Anomaly Transformer · LightGBM · BGE-M3
- 입력
- 정제 텍스트, 문장 임베딩, 고득점 코퍼스 분포
- 출력
- 문장별 이상 점수, 오류 의심 구간, 기준별 보정 점수
- M3개발 목표
근인 2단계 분류·RAG 처방
오류를 표층 원인과 심층 원인으로 나누고, 채점기준 조항을 근거로 인용합니다.
- 적용 모델
- KoELECTRA · BGE-M3 · bge-reranker
- 입력
- 이상 구간, 답안 전문, 공식 채점기준·모범답안 지식베이스
- 출력
- 표층/심층 원인 라벨, 근거 인용, 처방 우선순위
- M4개발 목표
이탈 예측·개입 최적화
학습이 끊길 위험을 미리 알아보고 개입 시점과 내용을 조정합니다.
- 적용 모델
- CatBoost · Temporal Fusion Transformer · Contextual Bandit
- 입력
- 응시 빈도, 점수 추이, 피드백 열람 로그, 처방 완료율
- 출력
- 이탈 위험 점수, 4주 진전도 예측, 개입 액션, 관리자 알림
- M5개발 목표
생성형 맞춤 처방 콘텐츠
목표 점수 수준의 모범답안과 연습 문항, 단계별 코멘트를 만들어 냅니다.
- 적용 모델
- Claude + LoRA · RAG · 구조 제어 모듈
- 입력
- 원인-근거-처방, 학습자 상태, 목표 밴드/점수
- 출력
- 맞춤 모범답안, 연습 문제 세트, 첨삭 코멘트, 어휘·문법 카드
시스템 구조
답안 한 편이 지나가는 길
제출된 답안은 구조 인식에서 진단, 원인 분류, 처방 생성 순서로 흐릅니다. 행동 로그는 따로 이탈 예측으로 들어갑니다. 결과는 학습자에게 리포트로, 관리자에게 위험 학생 알림으로 나갑니다.
UI
학습자 웹·모바일(응시, 리포트, 진전도)과 학원 관리자 콘솔(반별 통계, 위험 학생 알림)
Service
인증·구독·응시 세션 관리, 채점 요청 오케스트레이션, 학습 이력 추적, 알림
AI Engine
구조 인식, 이상탐지 진단, 근인 분류와 근거 검색, 처방 생성, 이탈 예측
Data
답안 원본, 채점 결과와 임베딩, 행동 로그 시계열, 채점기준·모범답안 지식베이스
정량 성능 목표
무엇을 어디까지 올릴 것인가
아래는 연구개발 기간 동안 달성하려는 목표치입니다. 현재 서비스가 내고 있는 수치가 아니며, 검증 결과는 공개 시점에 갱신합니다.
| 모듈 | 지표 | 목표 |
|---|---|---|
| M1 | 구조 요소 검출 mAP@0.5 | 0.90 이상 |
| M1 | OCR 정합 CER | 5% 이하 |
| M2 | 점수 예측 MAE | ±0.3 Band · ±2점 이하 |
| M2 | 공식 채점 대비 상관계수 | Pearson r 0.85 이상 |
| M3 | 원인 분류 Macro-F1 | 0.82 이상 |
| M3 | 근거 문서 검색 Recall@10 | 0.90 이상 |
| M4 | 이탈 예측 AUC | 0.80 이상 |
| M5 | 생성 답안 규격 준수율 | 95% 이상 |
| M5 | 환각(사실 왜곡) 발생률 | 5% 이하 |
지식재산
진단에서 재검증까지 돌아오는 폐쇄 루프
진단에서 원인분류, 처방, 효과검증을 거쳐 다시 진단으로 돌아오는 구조를 권리화 대상으로 보고 있습니다. 아래 세 건은 출원을 준비하고 있으며, 아직 출원되지 않았습니다.
- 01출원 준비 중
답안 구조 인식과 채점기준 정합을 이용한 작문 자동 진단 방법
문단·문장 구조를 정량 지표로 바꾸고 채점기준 항목과 대응시키는 절차
- 02출원 준비 중
오류 구간의 표층·심층 원인 2단계 분류와 근거 인용 처방 생성 방법
검출된 오류를 원인 계층으로 나누고 채점기준 조항을 근거로 처방을 만드는 절차
- 03출원 준비 중
재작성 결과 비교를 통한 처방 효과 검증과 다음 훈련 결정 방법
같은 문항의 재작성 전후를 비교해 처방의 효과를 측정하고 다음 훈련을 고르는 절차
개발 로드맵
12개월
연구개발 과제 기준 일정입니다.
1–2개월
데이터 구축
실전 답안과 채점 라벨 정비, 채점기준·모범답안 지식베이스 구성
3–4개월
구조 인식 엔진
손글씨 답안 세그멘테이션과 구조 요소 검출 파인튜닝
5–6개월
진단·이상탐지
고득점 분포 기반 이상 구간 탐지와 점수 보정 회귀
7–8개월
근인 분류·근거 검색
표층·심층 원인 분류기와 근거 문서 검색·재순위화
9–10개월
처방 생성·개인화
구조 제약을 지키는 생성과 이탈 예측·개입 정책
11개월
베타 운영
파트너 학원과 개인 응시자 대상 실증
12개월
성능 개선·상용화
검수 결과 반영, 정량 목표 검증, 정식 출시
사업 모델
개인에서 시작해 학원과 기관으로 넓힙니다.
개인 구독으로 데이터를 쌓고, 그 데이터로 학원 관리자에게 필요한 지표를 만듭니다.
- B2C
개인 응시자 구독
시험별 월 구독. 첫 모의고사는 구독 등록 시 무료로 제공합니다.
- B2B
학원·기업 라이선스
반별 성취도, 위험 학생 알림, 처방 콘텐츠 배포를 포함한 관리자 콘솔.
- B2G
공공·교육기관
유학 준비 과정과 교육기관의 작문 평가 인프라로 확장.