AI와 비즈니스

생성형 AI 생산성은 왜 엇갈리나|하루 26분 절약과 개발 19% 지연 읽는 법

talkdesalon 2026. 9. 6. 14:28

생성형 AI 도입 보고서에는 ‘몇 분 절약’, ‘몇 퍼센트 향상’ 같은 숫자가 자주 등장한다. 그러나 초안 작성이 빨라졌다는 말과 조직의 생산성이 올랐다는 말은 같지 않다. 검토·수정·승인에 든 시간, 오류와 재작업, 라이선스와 교육비, 절약한 시간을 어디에 썼는지까지 보아야 한다. 이 글은 제공된 2025~2026년 원자료 범위에서 자기보고, 통제실험, 노동시장 지표를 구분해 읽는 방법을 정리한다.

  • 시간 절감 자기보고는 유용한 신호지만 시스템 로그나 산출량 측정과 동일하지 않다.
  • 과업, 사용자 숙련도, 품질 기준에 따라 AI 효과의 방향까지 달라질 수 있다.
  • ROI를 주장하기 전에 검수와 재작업을 포함한 총시간과 품질을 함께 측정해야 한다.

같은 나무 조각이 담긴 두 작업 트레이 사이의 모래시계를 자연광에서 촬영한 설명용 사진

같은 나무 조각이 담긴 두 작업 트레이 사이의 모래시계로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

‘빨라졌다’는 말을 세 종류로 나눠야 한다

첫째는 사용자의 체감과 자기보고다. 짧은 기간에 큰 집단의 반응을 파악하기 좋지만 기억 오류와 기대 효과가 섞일 수 있다. 둘째는 실제 과업 시간을 비교하는 통제실험이다. 인과관계를 보기에는 강하지만 참가자와 과업이 좁으면 다른 직무로 일반화하기 어렵다. 셋째는 소득, 근로시간, 처리량처럼 조직이나 노동시장에 남는 결과다. 변화가 늦게 나타날 수 있고 다른 요인의 영향도 받는다. 세 지표는 경쟁 관계가 아니라 서로 다른 질문에 답한다.

따라서 절감률이나 절약 시간을 만났다면 무엇을 줄였는지부터 묻는다. 초안 시간인지, 검토를 포함한 완료 시간인지, 전체 근무시간인지가 없으면 해석할 수 없다. 비교군, 표본 수, 관측 기간, 비용, 실패 사례를 함께 확인해야 서로 다른 연구를 같은 성과표처럼 오해하지 않는다.

매끈한 나무 블록 더미와 표면이 거친 나무 블록 하나를 자연광에서 촬영한 설명용 사진

매끈한 나무 블록 더미와 표면이 거친 나무 블록 하나로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

영국 정부 시험: 하루 26분과 19분은 자기보고다

영국 GDS는 2024년 9월 30일부터 12월 31일까지 정부 직원 2만 명에게 Microsoft 365 Copilot 라이선스를 제공했다. 참여자는 하루 평균 26분을 절약했다고 보고했다. 다만 이 값은 응답 구간의 중간값을 사용했고 ‘1시간 이상’은 60분으로 계산했다. 보고서도 절약된 시간이 실제로 어디에 쓰였는지는 확인하지 못했다고 밝혔다. 복잡하거나 미묘한 판단, 데이터가 많은 업무에서는 한계가 있었고 민감정보 우려로 사용이 줄어든 사례도 있었다.

DWP의 2024년 10월~2025년 3월 시험에는 3,549명이 참여했다. 분석상 하루 평균 19분 절약, 사용자 90%의 시간 절감 보고가 나왔다. 하지만 라이선스는 무작위로 배정되지 않았고 사전 기준선도 없었다. 기술 친화적이고 동기가 높은 직원이 선택됐을 가능성과 응답 편향을 보고서 자체가 인정한다. 두 시험은 도구의 활용 가능성을 보여주지만, 모든 직원이 매일 같은 시간을 객관적으로 절약한다는 증거는 아니다.

빈 트레이와 베어링이 흩어진 트레이를 자연광에서 촬영한 설명용 사진

빈 트레이와 베어링이 흩어진 트레이로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

METR 통제실험: 숙련 개발자는 오히려 19% 느렸다

METR는 숙련 오픈소스 개발자 16명이 익숙한 대형 저장소의 실제 이슈 246개를 해결하도록 하고, AI 사용 허용과 금지 조건을 무작위로 배정했다. 이 범위에서는 AI 허용 시 완료 시간이 평균 19% 더 길었다. 참가자는 실험 전에 24% 빨라질 것으로 예상했고, 실험 뒤에도 20% 빨라졌다고 인식했다. 체감과 관측 결과가 반대일 수 있음을 보여주는 대목이다.

그렇다고 ‘AI 코딩은 언제나 느리다’고 결론내려서는 안 된다. 이 실험은 자신이 잘 아는 성숙한 저장소에서 높은 품질 기준으로 일하는 숙련자를 다뤘다. 새 프로젝트, 초보자, 단순한 코드 생성에는 결과가 다를 수 있다. METR의 2026년 후속 연구도 AI 없는 조건을 꺼리는 참가자 증가와 여러 에이전트를 동시에 쓰는 상황의 시간 측정 문제 때문에 신뢰할 만한 단일 효과치를 내기 어렵다고 설명했다.

작은 닫힌 금속 상자 옆의 유리 모래시계를 자연광에서 촬영한 설명용 사진

작은 닫힌 금속 상자 옆의 유리 모래시계로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

노동시장에서는 업무 재편이 먼저 보였다

NBER 연구는 덴마크의 설문과 행정 노동기록을 연결해 생성형 AI의 초기 영향을 살폈다. 2025년 발표 후 2026년 3월 개정된 연구는 ChatGPT 출시 2년 뒤 근로자와 사업장의 소득, 기록상 근로시간에서 정밀한 영효과를 추정했고 2%보다 큰 평균 효과를 배제했다. 반면 콘텐츠 생성, AI 감독, AI 통합 같은 새 과업과 업무 재편은 관측됐다.

이는 ‘아무 효과가 없다’는 선언이 아니다. 조직이 기존 일을 줄이는 대신 검증과 통합이라는 새 일을 만들 수 있고, 그 변화가 아직 소득이나 근로시간 평균에 나타나지 않았다는 뜻에 가깝다. 단기 사용량을 장기 재무성과로 곧장 환산하면 이 중간 단계를 놓친다.

원형 나무 토큰 여섯 개와 서로 떨어진 반원형 나무 조각 두 개를 자연광에서 촬영한 설명용 사진

원형 나무 토큰 여섯 개와 서로 떨어진 반원형 나무 조각 두 개로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

실무 측정은 총시간·품질·비용을 한 묶음으로 본다

도입 전 2~4주의 기준선을 잡고 과업을 단순 작성, 검색, 분석, 복잡한 판단으로 나눈다. 그다음 초안 시간뿐 아니라 검토·수정·승인까지의 완료 시간을 기록한다. 오류율, 고객 불만, 코드 결함, 규정 위반과 같은 품질 지표를 같은 표에 둔다. 신규 사용자와 숙련 사용자를 분리하고, 자기보고와 시스템 로그를 나란히 비교하면 기대 효과가 결과를 가리는 일을 줄일 수 있다.

비용에는 라이선스만 넣지 않는다. 교육, 보안 검토, 데이터 정비, 관리자 승인, 재작업도 포함한다. 절약된 시간이 실제 고부가가치 업무로 이동했는지 확인하고 팀별 평균뿐 아니라 편차와 실패 사례를 공개한다. 작은 비교군이나 단계적 도입은 계절성과 선택 편향을 줄이는 현실적인 방법이다.

표면이 매끈한 금속 부품 두 개와 표면이 거친 금속 부품 하나를 자연광에서 촬영한 설명용 사진

표면이 매끈한 금속 부품 두 개와 표면이 거친 금속 부품 하나로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

도입 전 체크리스트

  • 처리시간, 산출량, 오류율, 재작업률의 도입 전 기준선을 확보한다.
  • 초안이 아니라 검토·수정·승인까지 포함한 총시간을 측정한다.
  • 단순 작성, 검색, 분석, 복잡한 판단을 과업별로 분리한다.
  • 신규 사용자와 숙련 사용자의 결과를 따로 본다.
  • 자기보고 시간과 시스템 로그 기반 시간을 함께 기록한다.
  • 품질, 고객 영향, 규정 위반과 실패 사례를 성과표에 포함한다.
  • 라이선스·교육·보안·검수·재작업을 총비용에 넣는다.
  • 비교군 또는 단계적 도입으로 선택 편향을 줄인다.

별도 검사등 옆의 기계식 기어 조립부를 자연광에서 촬영한 설명용 사진

별도 검사등 옆의 기계식 기어 조립부로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

FAQ

Q1. 하루 26분 절약을 우리 회사에도 적용해도 되나요?

A. 아니다. 영국 정부 시험 참여자의 자기보고 평균이며 계산 방식과 업무 환경이 정해져 있다. 내부 기준선으로 별도 검증해야 한다.

Q2. METR 결과는 AI 코딩을 중단해야 한다는 뜻인가요?

A. 아니다. 숙련자가 익숙한 대형 저장소를 수정한 특정 조건의 결과다. 과업과 사용자 집단을 맞춰 재시험해야 한다.

Q3. 가장 먼저 볼 KPI는 무엇인가요?

A. 검수까지 포함한 완료 시간과 오류·재작업률을 함께 본다. 둘 중 하나만 보면 속도와 품질의 교환을 놓친다.

Q4. ROI는 언제 계산해야 하나요?

A. 충분한 기준선과 비교 기간을 확보하고 교육·보안·검수 비용, 실제 시간 재배치까지 확인한 뒤 제한된 범위에서 계산한다.

결론은 AI가 빠르거나 느리다는 단일 판정이 아니다. 숫자의 측정 수준을 구분하고, 우리 업무의 품질 기준과 비용 구조 안에서 다시 재는 것이 AX 성과관리의 출발점이다.

작업대 위 여러 형태로 놓인 단색 블록을 자연광에서 촬영한 설명용 사진

작업대 위 여러 형태로 놓인 단색 블록으로 생성형 AI 생산성 측정을 설명하는 이미지. ※ 생성형 AI로 만든 이해용 이미지이며, 실제 기업·기관 현장 기록 사진이 아닙니다.

출처