본문으로 건너뛰기

개발 이유

첨삭이 부족해서가 아니라, 기준이 없어서 생긴 문제입니다.

국내 IELTS·TOEFL Writing 첨삭은 강사 개인의 경험에 크게 기대고 있습니다. 문제는 성의가 아니라 구조입니다.

  • 채점자 편차

    공식 채점기준을 체화하는 데는 시간이 걸립니다. 기준이 다르면 같은 답안에 다른 피드백이 나오고, 학습자는 무엇을 믿어야 할지 알 수 없습니다.

  • 처리량의 물리적 한계

    한 사람이 한 시간에 꼼꼼히 볼 수 있는 답안은 두세 편입니다. 성수기에는 대기가 생기고, 학원은 강사를 더 뽑아야 확장됩니다.

  • 원인까지 가지 않는 피드백

    오류의 정오 표시에 그치면, 그 오류가 표층 실수인지 과제 이해 부족인지 구분되지 않습니다. 같은 실수가 반복되는 이유입니다.

  • 쌓이지 않는 학습 이력

    응시와 첨삭이 기록으로 남지 않으면 진전도를 숫자로 볼 수 없고, 학원도 위험한 학생을 미리 알아볼 수 없습니다.

그래서 채점·진단·원인분석·처방·재검증을 하나의 파이프라인으로 묶었습니다. 사람을 대신하려는 것이 아니라, 사람이 반복하기 어려운 일을 기계가 맡는 구조입니다.

연구개발 과제

다섯 개 엔진으로 진단에서 처방까지 잇습니다.

현재 서비스는 Claude 기반 자동 채점으로 동작합니다. 아래 다섯 모듈은 이 파이프라인을 고도화하기 위한 연구개발 과제이며, 아직 구현된 성능이 아닙니다.

현재 동작

공식 채점기준을 근거로 한 Claude 기반 자동 채점 · 문장 단위 진단 · 맞춤 처방 생성

  • M1개발 목표

    멀티모달 답안 구조 인식

    손글씨 답안지에서 문단·문장·구조 요소를 추출해 정량 지표로 바꿉니다.

    적용 모델
    SAM2 · RT-DETR · DINOv2 · TrOCR
    입력
    손글씨 스캔 이미지 또는 타이핑 원고, 시험 유형
    출력
    문단별 구조 태그, 문장 경계, 구조 완성도 점수, 정제 텍스트
  • M2개발 목표

    정밀 진단·이상탐지

    고득점 답안 분포에서 벗어난 구간을 찾아 위치를 특정하고 점수를 보정합니다.

    적용 모델
    PatchCore · Anomaly Transformer · LightGBM · BGE-M3
    입력
    정제 텍스트, 문장 임베딩, 고득점 코퍼스 분포
    출력
    문장별 이상 점수, 오류 의심 구간, 기준별 보정 점수
  • M3개발 목표

    근인 2단계 분류·RAG 처방

    오류를 표층 원인과 심층 원인으로 나누고, 채점기준 조항을 근거로 인용합니다.

    적용 모델
    KoELECTRA · BGE-M3 · bge-reranker
    입력
    이상 구간, 답안 전문, 공식 채점기준·모범답안 지식베이스
    출력
    표층/심층 원인 라벨, 근거 인용, 처방 우선순위
  • M4개발 목표

    이탈 예측·개입 최적화

    학습이 끊길 위험을 미리 알아보고 개입 시점과 내용을 조정합니다.

    적용 모델
    CatBoost · Temporal Fusion Transformer · Contextual Bandit
    입력
    응시 빈도, 점수 추이, 피드백 열람 로그, 처방 완료율
    출력
    이탈 위험 점수, 4주 진전도 예측, 개입 액션, 관리자 알림
  • M5개발 목표

    생성형 맞춤 처방 콘텐츠

    목표 점수 수준의 모범답안과 연습 문항, 단계별 코멘트를 만들어 냅니다.

    적용 모델
    Claude + LoRA · RAG · 구조 제어 모듈
    입력
    원인-근거-처방, 학습자 상태, 목표 밴드/점수
    출력
    맞춤 모범답안, 연습 문제 세트, 첨삭 코멘트, 어휘·문법 카드

시스템 구조

답안 한 편이 지나가는 길

제출된 답안은 구조 인식에서 진단, 원인 분류, 처방 생성 순서로 흐릅니다. 행동 로그는 따로 이탈 예측으로 들어갑니다. 결과는 학습자에게 리포트로, 관리자에게 위험 학생 알림으로 나갑니다.

답안 제출
  1. UI

    학습자 웹·모바일(응시, 리포트, 진전도)과 학원 관리자 콘솔(반별 통계, 위험 학생 알림)

  2. Service

    인증·구독·응시 세션 관리, 채점 요청 오케스트레이션, 학습 이력 추적, 알림

  3. AI Engine

    구조 인식, 이상탐지 진단, 근인 분류와 근거 검색, 처방 생성, 이탈 예측

  4. Data

    답안 원본, 채점 결과와 임베딩, 행동 로그 시계열, 채점기준·모범답안 지식베이스

리포트 · 처방 · 알림

정량 성능 목표

무엇을 어디까지 올릴 것인가

아래는 연구개발 기간 동안 달성하려는 목표치입니다. 현재 서비스가 내고 있는 수치가 아니며, 검증 결과는 공개 시점에 갱신합니다.

개발 목표
모듈지표목표
M1구조 요소 검출 mAP@0.50.90 이상
M1OCR 정합 CER5% 이하
M2점수 예측 MAE±0.3 Band · ±2점 이하
M2공식 채점 대비 상관계수Pearson r 0.85 이상
M3원인 분류 Macro-F10.82 이상
M3근거 문서 검색 Recall@100.90 이상
M4이탈 예측 AUC0.80 이상
M5생성 답안 규격 준수율95% 이상
M5환각(사실 왜곡) 발생률5% 이하

지식재산

진단에서 재검증까지 돌아오는 폐쇄 루프

진단에서 원인분류, 처방, 효과검증을 거쳐 다시 진단으로 돌아오는 구조를 권리화 대상으로 보고 있습니다. 아래 세 건은 출원을 준비하고 있으며, 아직 출원되지 않았습니다.

  • 01출원 준비 중

    답안 구조 인식과 채점기준 정합을 이용한 작문 자동 진단 방법

    문단·문장 구조를 정량 지표로 바꾸고 채점기준 항목과 대응시키는 절차

  • 02출원 준비 중

    오류 구간의 표층·심층 원인 2단계 분류와 근거 인용 처방 생성 방법

    검출된 오류를 원인 계층으로 나누고 채점기준 조항을 근거로 처방을 만드는 절차

  • 03출원 준비 중

    재작성 결과 비교를 통한 처방 효과 검증과 다음 훈련 결정 방법

    같은 문항의 재작성 전후를 비교해 처방의 효과를 측정하고 다음 훈련을 고르는 절차

개발 로드맵

12개월

연구개발 과제 기준 일정입니다.

  1. 1–2개월

    데이터 구축

    실전 답안과 채점 라벨 정비, 채점기준·모범답안 지식베이스 구성

  2. 3–4개월

    구조 인식 엔진

    손글씨 답안 세그멘테이션과 구조 요소 검출 파인튜닝

  3. 5–6개월

    진단·이상탐지

    고득점 분포 기반 이상 구간 탐지와 점수 보정 회귀

  4. 7–8개월

    근인 분류·근거 검색

    표층·심층 원인 분류기와 근거 문서 검색·재순위화

  5. 9–10개월

    처방 생성·개인화

    구조 제약을 지키는 생성과 이탈 예측·개입 정책

  6. 11개월

    베타 운영

    파트너 학원과 개인 응시자 대상 실증

  7. 12개월

    성능 개선·상용화

    검수 결과 반영, 정량 목표 검증, 정식 출시

사업 모델

개인에서 시작해 학원과 기관으로 넓힙니다.

개인 구독으로 데이터를 쌓고, 그 데이터로 학원 관리자에게 필요한 지표를 만듭니다.

  • B2C

    개인 응시자 구독

    시험별 월 구독. 첫 모의고사는 구독 등록 시 무료로 제공합니다.

  • B2B

    학원·기업 라이선스

    반별 성취도, 위험 학생 알림, 처방 콘텐츠 배포를 포함한 관리자 콘솔.

  • B2G

    공공·교육기관

    유학 준비 과정과 교육기관의 작문 평가 인프라로 확장.

기술 — Writing PT