2025 · AI/프로젝트
AI 코파일럿과 함께 설계하는 서비스 프로토타이핑
학생이 문제를 정의하고 AI 코파일럿을 리서치·비평·프로토타이핑 파트너로 활용한 스튜디오형 수업입니다.

학생이 완성된 답을 받는 대신 더 좋은 질문과 검증 가능한 근거를 만드는 데 AI를 사용한 2025학년도 2학기 서비스 프로토타이핑 스튜디오입니다. 84명의 학생이 15주 동안 인터뷰, 가설, 화면 프로토타입, 공개 비평을 반복했습니다.
1. 수업 맥락과 문제
서비스 아이디어를 짧은 시간에 만들 수 있는 생성형 AI 도구가 확산되면서, 학생의 결과물만 보고 문제 정의와 판단 과정을 확인하기 어려워졌습니다. 빠르게 화면을 만드는 것이 실제 사용자 문제를 잘 이해했다는 뜻은 아니었습니다. 교수자는 AI를 대필자나 자동 채점기가 아니라 반례를 만드는 동료로 정의하고, 학생이 생성된 제안을 검증하고 수정한 흔적을 남기게 했습니다.
팀마다 생활 속 불편을 하나 선택했지만, 처음부터 해결책을 정하지 않았습니다. 인터뷰 카드와 가설을 먼저 만들고, 핵심 주장 옆에 원문 링크·검증 상태·수정 이유를 기록하게 했습니다. AI 사용 여부가 아닌 문제 정의의 선명도와 사용자 근거를 평가의 중심에 두었습니다.
2. 학습 목표와 설계
학습 목표는 사용자의 상황을 관찰해 문제를 정의하고, AI 아이디어를 여러 근거와 대조하며, 프로토타입으로 가설을 검증하고, 선택과 포기의 이유를 설명하는 것이었습니다. 주차 구간과 교수자 개입, 남는 증거를 다음처럼 연결했습니다.
| 구간 | 학생 활동 | 교수자 개입 | 남는 데이터 |
|---|---|---|---|
| 1–3주 | 문제 인터뷰와 질문 재작성 | 질문 범위 조정 | 인터뷰 카드 184장 |
| 4–7주 | AI 아이디어 발산과 근거 대조 | 출처 품질 코칭 | 검증 로그 412건 |
| 8–11주 | 프로토타입·사용성 테스트 | 팀별 1:1 스튜디오 | 테스트 세션 68회 |
| 12–15주 | 공개 비평과 수정 | 루브릭 공동 해석 | 회고 에세이 84편 |
출처 온도계는 링크의 신뢰도와 직접성을 세 단계로 표시했고, 반례 카드는 AI가 제안한 해결책의 실패 조건을 한 장으로 적게 했습니다. 생성량과 프롬프트 수는 평가 점수에 포함하지 않았습니다.
3. 운영 과정
1–3주에는 팀이 사용자를 인터뷰하고 질문의 범위를 좁혔습니다. 4–7주에는 AI에게 여러 아이디어와 반례를 요청한 뒤, 원문 링크와 직접 대조했습니다. 8–11주에는 저해상도 화면을 빠르게 만들고 실제 사용자의 반응을 받아 가설을 수정했습니다. 마지막 4주는 데모데이에서 선택과 포기의 이유, 아직 검증하지 못한 조건을 설명했습니다.
교수자는 프롬프트 문장을 평가하기보다 팀이 왜 결과를 버렸는지 물었습니다. 공개 로그에는 버전별 스크린샷보다 판단의 변화와 확인한 근거를 우선 기록했습니다. 사용자의 개인정보가 포함될 수 있는 인터뷰 기록은 익명화하고, 팀 외 공개 범위를 최소화했습니다.
4. 평가와 관찰
가상 운영 기록에서 프로젝트 완주율은 93%, 피드백 반영 평점은 4.6/5, 중도 이탈은 6명, AI 검증 로그는 1,248건으로 집계되었습니다. 주차별 산출물 품질 점수는 AI 코파일럿 기록에서 1주 52점에서 15주 91점으로 관찰되었습니다.
| 관찰 지표 | 기록값 | 근거 | 해석 범위 |
|---|---|---|---|
| 문제 정의 | 88점 | 루브릭 평균 | 질문과 사용자 근거 |
| 근거 수집 | 81점 | 출처 품질 | 링크 검증 상태 |
| 프로토타입 | 92점 | 완성도 평가 | 테스트 반영 포함 |
| 성찰 에세이 | 86점 | 회고 루브릭 | 판단의 한계 설명 |
AI를 사용한 횟수가 많은 팀보다 질문을 수정하고 근거를 다양하게 비교한 팀의 회고가 더 구체적으로 보이는 경향은 관찰되었습니다. 그러나 위 지표는 가상 수업 안의 기록이며, AI 사용이 프로젝트 성과를 직접 만들었다는 근거로 해석하지 않습니다.
5. 시행착오와 한계
초반에는 AI 생성량이 많은 팀이 유리해 보였고, 학생이 출처가 약한 문장을 그대로 제안서에 넣는 문제가 있었습니다. 이후 생성물마다 검증 상태와 실패 조건을 적게 하고, 공개 비평에서 다른 팀이 근거의 직접성을 질문하게 했습니다. 프롬프트 공유가 개인의 평가 자료가 되지 않도록 판단 로그와 도구 사용 로그의 목적도 분리했습니다.
사용자 인터뷰의 표본이 작고, AI가 제안한 정보의 최신성과 편향을 매번 사람이 확인해야 합니다. 도구의 모델이나 접근 조건이 바뀌면 활동의 결과도 달라질 수 있습니다. 화면이 완성되어도 실제 사용자의 문제를 해결하지 못할 수 있으므로, 프로토타입 품질과 문제 적합성을 별도 항목으로 기록했습니다.
6. 다음 운영과 적용 조건
다음 학기에는 생성량을 경쟁 지표로 쓰지 않고 질문 수정 횟수와 근거의 다양성을 핵심 과정 지표로 삼을 예정입니다. 인터뷰와 첫 사용성 테스트를 앞당겨 초반에 문제 범위를 좁히고, 검증 로그를 매주 짧은 형식으로 제출해 마지막 주의 기록 부담을 줄입니다.
이 사례를 적용하려면 AI 사용 범위와 개인정보 보호 규칙, 출처 확인 방법, 사용자가 직접 판단하는 단계, 도구가 중단되었을 때의 비AI 대체 활동을 미리 합의해야 합니다. AI가 잘 만든 화면보다 학생이 실패 조건과 다음 질문을 설명할 수 있는지가 핵심 적용 조건입니다.
※ 본문의 수치·인물·인터뷰·학습 기록은 포트폴리오 시연을 위해 구성한 가상 데이터이며, 실제 수업 성과나 AI의 인과적 효과를 의미하지 않습니다.
아래 수치와 결과는 실제 기관의 성과가 아닌 포트폴리오용 시뮬레이션입니다.
주차별 산출물 품질 점수
관찰 지표
학생–AI–교수의 검증 루프
수업 운영 타임라인
질문 만들기
현장 인터뷰로 문제를 좁히고 AI에게 답이 아닌 반례를 요청
근거 대조
생성 결과마다 원문 링크와 검증 상태를 카드로 기록
프로토타이핑
저해상도 화면을 빠르게 만들고 사용자 피드백을 반복 수집
공개 비평
팀 간 데모데이에서 선택과 포기의 이유를 설명
대표 학습자 경험 카드
| 지표 | 사전 설문 | 사후 설문 | 변화 |
|---|---|---|---|
| 과제 명확성 | 3.1 | 4.4 | +1.3 |
| 피드백 활용 자신감 | 2.8 | 4.2 | +1.4 |
| AI 결과 검증 습관 | 2.2 | 4.5 | +2.3 |
| 팀 협업 만족도 | 3.5 | 4.3 | +0.8 |