← 전문가 노트

Notes · 2026-08-26

[자율제조 시리즈 ⑨] 자율제조는 왜 Edge AI와 Cloud AI를 함께 사용해야 하는가?

현장의 빠른 판단과 공장 전체의 지능을 연결하는 분산형 AI 구조

제조기업이 AI를 도입할 때 가장 먼저 결정해야 하는 것 중 하나는 AI를 어디에서 실행할 것인가이다.

공장에서 발생한 데이터를 클라우드로 전송하고 대규모 서버에서 분석할 수도 있다.

설비 옆에 설치한 산업용 컴퓨터나 Edge Gateway에서 AI를 실행할 수도 있으며, 카메라와 센서, 로봇과 같은 장치 자체에서 AI 모델을 실행할 수도 있다.

클라우드는 대규모 데이터를 저장하고 복잡한 모델을 학습하는 데 유리하다.

여러 공장과 생산라인의 데이터를 통합해 전사 생산계획과 공급망을 최적화할 수도 있다. 필요에 따라 컴퓨팅 자원을 확대하고 중앙에서 AI 모델을 관리하기에도 적합하다.

그러나 제조현장의 모든 판단을 클라우드에 맡길 수는 없다.

제품이 컨베이어를 빠르게 통과하는 동안 불량을 판정해야 하고, 작업자와 로봇이 위험하게 접근하면 즉시 움직임을 중단해야 한다.

설비의 진동이 급격하게 증가했을 때도 통신상태와 관계없이 현장에서 대응할 수 있어야 한다.

공장의 외부통신망이 끊기거나 클라우드 서비스에 장애가 발생했다고 해서 생산과 안전기능이 모두 중단되어서는 안 된다.

반대로 모든 AI 기능을 현장의 Edge에 설치하는 것도 효율적이지 않다.

복잡한 AI 모델을 학습하려면 많은 데이터와 컴퓨팅 자원이 필요하다. 여러 공장에 배포된 모델을 개별적으로 관리하면 버전과 보안, 성능을 일관되게 유지하기 어렵다.

따라서 다음과 같은 질문이 필요하다.

“Edge AI와 Cloud AI 가운데 무엇을 선택해야 하는가?”

가 아니라,

“어떤 판단은 현장에서 수행하고, 어떤 판단은 중앙에서 수행하며, 두 결과를 어떻게 연결할 것인가?”

자율제조에서 Edge와 Cloud는 서로를 대체하는 기술이 아니다.

Edge는 현장의 상태를 빠르게 인식하고 통신장애에도 필요한 판단을 수행하며, Cloud는 여러 현장의 데이터와 지식을 이용해 학습과 장기 최적화를 담당한다.

이번 글에서는 자율제조가 왜 Edge AI와 Cloud AI를 함께 사용해야 하며, 두 영역의 역할과 데이터, 모델과 실행권한을 어떻게 나누어야 하는지 살펴보고자 한다.


목차

  1. 제조 AI는 왜 실행위치가 중요한가
  2. Device AI와 Edge AI, Cloud AI는 무엇이 다른가
  3. 어떤 제조업무를 Edge에서 처리해야 하는가
  4. Cloud AI는 자율제조에서 무엇을 담당하는가
  5. Edge와 Cloud는 데이터와 모델을 어떻게 나누는가
  6. 통신이 끊겨도 공장은 어떻게 안전하게 운영되는가
  7. AI 모델은 Edge에 어떻게 배포하고 관리하는가
  8. Edge–Cloud 연결에는 어떤 보안이 필요한가
  9. 현실적인 Edge–Cloud 제조 AI 구축방법
  10. 경영진은 AI의 위치보다 무엇을 확인해야 하는가

1. 제조 AI는 왜 실행위치가 중요한가

같은 AI 모델이라도 어디에서 실행되는가에 따라 성능과 위험이 달라진다.

제품의 품질을 검사하는 비전 AI를 예로 들어보자.

카메라에서 촬영한 영상을 클라우드로 전송하고 판정결과를 다시 받아 불량품을 배출할 수 있다.

이 방식은 중앙의 높은 컴퓨팅 성능을 활용할 수 있다.

그러나 네트워크 지연과 데이터 전송시간이 생산속도보다 길어지면 제품이 배출위치를 지나간 뒤 결과가 도착할 수 있다.

통신이 일시적으로 끊기면 검사 자체가 중단될 수도 있다.

반대로 카메라 가까이에 있는 Edge 장치에서 AI를 실행하면 영상을 외부로 전송하지 않고 빠르게 결과를 얻을 수 있다.

통신이 끊겨도 검사를 계속할 수 있고 대용량 영상의 네트워크 사용량도 줄일 수 있다.

하지만 Edge 장치의 연산성능과 저장공간은 제한되어 있다.

복잡한 모델을 학습하거나 여러 공장의 데이터를 장기간 분석하는 데는 적합하지 않을 수 있다.

AI의 실행위치를 결정할 때는 다음의 조건을 함께 고려해야 한다.

① 지연시간

데이터가 발생한 뒤 몇 밀리초 또는 몇 초 안에 판단해야 하는가.

② 통신 안정성

외부통신이 끊겨도 기능을 유지해야 하는가.

③ 데이터의 양

고해상도 영상과 고주파 진동처럼 전송량이 많은 데이터인가.

④ 데이터 보호

도면과 제품영상, 공정조건을 외부로 전송해도 되는가.

⑤ 컴퓨팅 요구량

모델을 실행하거나 학습하는 데 어느 정도의 CPU와 GPU, 메모리가 필요한가.

⑥ 판단의 범위

하나의 설비와 공정을 판단하는가, 공장 전체와 여러 사업장을 최적화하는가.

⑦ 실행의 위험

판단결과가 단순한 보고서에 사용되는가, 설비와 로봇의 동작을 변경하는가.

⑧ 유지관리

여러 현장에 배포된 모델과 소프트웨어를 어떻게 갱신하고 감시할 것인가.

NIST의 Fog Computing 개념모델은 대규모·이기종 IoT 데이터를 모두 중앙 클라우드에서 처리할 경우 지연과 데이터 규모가 문제가 될 수 있으며, 컴퓨팅과 데이터 분석을 네트워크 가까이 분산하는 구조가 이를 보완할 수 있다고 설명한다. NIST SP 500-325, Fog Computing Conceptual Model

결국 AI의 실행위치는 단순한 서버 배치문제가 아니다.

제조업무의 응답시간과 연속성, 데이터 보호와 실행위험을 결정하는 운영설계의 문제다.


2. Device AI와 Edge AI, Cloud AI는 무엇이 다른가

현장 가까이에서 AI를 실행한다는 표현에는 여러 형태가 포함된다.

용어의 구분은 기술과 공급업체에 따라 다를 수 있지만, 제조현장의 실행위치를 기준으로 다음과 같이 이해할 수 있다.

① Device AI 또는 On-device AI

센서와 카메라, 로봇 또는 설비제어기와 같은 장치 자체에서 AI를 실행한다.

예를 들면 다음과 같다.

  • 스마트카메라의 외관불량 판정
  • 진동센서의 이상주파수 감지
  • 로봇의 물체인식
  • 작업자 접근 감지
  • 소형 MCU의 간단한 이상탐지

장점은 빠른 응답과 낮은 네트워크 의존성이다.

그러나 연산능력과 전력, 메모리와 저장공간이 제한되어 모델의 크기와 기능을 줄여야 할 수 있다.

② Machine Edge

개별 설비 또는 제조 셀 가까이에 설치된 산업용 컴퓨터에서 AI를 실행한다.

  • 설비별 예지보전
  • 공정조건 이상탐지
  • 비전검사
  • 로봇셀 상태분석
  • 실시간 품질예측

여러 센서와 장치의 데이터를 함께 분석할 수 있고 Device보다 높은 연산성능을 확보할 수 있다.

③ Factory Edge

생산라인이나 공장 내부의 Edge Server에서 여러 설비의 데이터를 통합해 처리한다.

  • 생산라인 병목분석
  • 여러 비전검사 모델 운영
  • 공장 내 AGV 배차
  • 공정 간 품질추적
  • 로컬 Digital Twin
  • 현장 AI Agent
  • 공장 에너지 최적화

공장 내부의 데이터를 외부로 보내지 않고 여러 설비의 관계를 분석할 수 있다.

④ Private Cloud 또는 On-premise Cloud

기업 내부 데이터센터나 사설 클라우드에서 여러 공장과 업무시스템을 통합한다.

  • 기업의 보안정책에 따른 중앙 AI 운영
  • 전사 제조데이터 통합
  • 대규모 모델 학습
  • 공장 간 성능비교
  • 기업 내부 지식그래프와 GraphRAG

데이터에 대한 통제력은 높지만 인프라 구축과 운영책임도 기업이 부담해야 한다.

⑤ Public Cloud

외부 클라우드의 컴퓨팅과 저장, AI 서비스를 이용한다.

  • 대규모 모델 학습
  • 장기간 데이터 저장과 분석
  • 여러 사업장의 통합 최적화
  • 생성형 AI와 Foundation Model 활용
  • 모델 배포와 운영관리
  • 협력사와 공급망 연계

필요에 따라 자원을 확장할 수 있지만 네트워크와 비용, 데이터 보호와 서비스 종속성을 검토해야 한다.

역할을 간단히 비교하면 다음과 같다.

구분주요 역할장점주요 제약
Device AI장치 단위 즉시 판단가장 빠른 응답, 통신 의존도 낮음연산·메모리 제한
Machine Edge설비·셀 단위 분석현장성, 비교적 높은 성능장치별 관리 필요
Factory Edge라인·공장 단위 최적화여러 설비 통합, 데이터 현장 유지공장 인프라 필요
Private Cloud기업 내부 통합데이터 통제, 전사 표준화구축·운영비용
Public Cloud대규모 학습·확장높은 컴퓨팅 성능과 확장성네트워크·보안·비용

중요한 것은 기술적으로 명확한 경계선을 긋는 것이 아니다.

실제 시스템에서는 Device와 Machine Edge, Factory Edge와 Cloud가 계층적으로 연결될 수 있다.

판단에 필요한 데이터와 응답시간, 실행위험에 따라 가장 적절한 위치에 기능을 배치하는 것이 중요하다.


3. 어떤 제조업무를 Edge에서 처리해야 하는가

모든 실시간 데이터가 Edge에서 AI로 처리되어야 하는 것은 아니다.

PLC와 모션컨트롤러가 이미 안정적으로 수행하는 고속 제어를 AI로 바꿀 이유도 없다.

Edge AI는 기존 제어시스템을 무조건 대체하는 기술이 아니라, 현장 가까이에서 추가적인 인식과 예측, 제한적 최적화를 제공하는 기술이다.

다음과 같은 제조업무는 Edge 처리가 유리하다.

① 빠른 응답이 필요한 품질검사

제품이 빠르게 이동하는 동안 불량을 판정하고 배출장치를 작동해야 한다.

  • 표면결함 검사
  • 조립누락 확인
  • 치수와 형상 판정
  • 라벨과 문자 인식
  • 용접상태 검사
  • 포장상태 확인

고해상도 영상을 모두 클라우드로 전송하는 대신 Edge에서 판정하고 불량영상과 주요 특징만 중앙에 전송할 수 있다.

② 안전과 가까운 상황인식

  • 작업자와 로봇의 위험접근
  • 보호구 착용 확인
  • 위험구역 침입
  • 연기와 불꽃 감지
  • 설비의 비정상 움직임

다만 AI의 영상판정만을 공식적인 안전기능으로 사용해서는 안 된다.

안전 PLC와 인터록, 비상정지와 같은 검증된 보호계층은 AI와 독립적으로 유지해야 한다.

③ 설비의 빠른 이상탐지

  • 진동과 온도의 급격한 변화
  • 전류와 토크 이상
  • 압력과 유량 이상
  • 공구 파손
  • 모터와 베어링 상태 변화

Edge에서는 고주파 데이터를 실시간으로 분석하고 이상구간만 저장하거나 중앙으로 보낼 수 있다.

④ 공정 중 품질예측

검사가 완료될 때까지 기다리지 않고 생산 중 공정조건을 이용해 품질위험을 예측한다.

  • 사출성형 중량과 치수 예측
  • 열처리 경도 예측
  • 용접품질 예측
  • 도금두께와 표면품질 예측
  • 절삭공정의 가공품질 예측

⑤ 로컬 물류와 이동체 운영

  • AGV와 AMR의 경로조정
  • 생산셀 간 자재이동
  • 장애물과 작업자 감지
  • 로컬 작업 우선순위 조정

공장 전체의 물류계획은 Factory Edge나 Cloud에서 최적화하고, 즉각적인 장애물 회피와 안전동작은 장치와 현장에서 처리할 수 있다.

⑥ 외부통신이 끊겨도 유지해야 하는 기능

  • 비전검사
  • 기본 이상탐지
  • 생산실적 임시저장
  • 현장 알람
  • 로컬 작업지시 확인
  • 제한된 공정조건 보정

⑦ 외부반출이 제한되는 데이터

  • 고객제품 영상
  • 도면과 제조조건
  • 국방·보안 관련 데이터
  • 작업자 영상
  • 핵심 공정의 레시피
  • 영업비밀에 해당하는 생산정보

Edge에서는 원본데이터를 현장에 유지하고 판정결과와 통계, 익명화된 특징정보만 중앙으로 전송할 수 있다.

NIST의 산업용 IoT Edge Deep Learning 연구는 대규모 데이터를 모두 Cloud로 보내 학습·분석할 경우 네트워크 혼잡과 성능저하가 발생할 수 있으며, Edge에서 처리하면 데이터 전송부담을 줄일 수 있음을 설명한다. NIST, Towards Edge-Based Deep Learning in Industrial Internet of Things

Edge에서 처리할 업무는 단순히 “빠른 업무”로만 정해서는 안 된다.

통신이 끊겨도 계속해야 하며, 데이터가 발생한 위치에서 즉시 판단해야 하고, 원본데이터를 외부로 보내기 어려운 업무를 우선해야 한다.


4. Cloud AI는 자율제조에서 무엇을 담당하는가

Edge AI가 현장의 빠른 판단을 담당한다고 해서 Cloud가 단순한 데이터 저장소로 남는 것은 아니다.

Cloud AI는 개별 설비와 공장의 범위를 넘어 대규모 데이터와 장기간의 제조경험을 분석하는 역할을 담당한다.

① 대규모 모델 학습

AI 모델을 학습하려면 많은 데이터와 연산자원이 필요하다.

  • 비전검사 모델 학습
  • 설비 고장예측 모델 학습
  • 품질예측 모델 학습
  • 수요예측과 생산계획 모델 학습
  • 도메인 언어모델과 GraphRAG
  • 다공장 최적화 모델

Edge에서는 학습된 모델의 추론을 수행하고, Cloud에서는 여러 현장에서 수집한 데이터를 이용해 모델을 개선할 수 있다.

② 장기간 데이터 분석

Edge 장치는 저장공간이 제한될 수 있다.

Cloud에서는 월별·연도별 데이터를 보관하고 다음을 분석할 수 있다.

  • 설비성능의 장기변화
  • 계절과 제품구성의 영향
  • 공장별 품질과 생산성 비교
  • 부품수명과 교체주기
  • 에너지와 탄소배출
  • 공급업체와 원재료 LOT의 영향

③ 여러 공장과 공급망의 최적화

Edge는 하나의 설비와 공장의 상태를 빠르게 판단하는 데 적합하다.

하지만 생산과 재고, 주문을 여러 사업장에 배분하려면 더 넓은 정보가 필요하다.

  • 공장별 생산능력
  • 설비와 금형의 가용성
  • 원재료와 부품재고
  • 고객납기
  • 물류시간과 비용
  • 에너지 가격
  • 공급망 위험

이러한 전사적 판단은 중앙의 Cloud 또는 기업 데이터센터가 담당하는 것이 적절하다.

④ 모델과 소프트웨어의 중앙관리

여러 Edge에 배포된 AI 모델을 중앙에서 관리한다.

  • 모델 등록과 승인
  • 버전관리
  • 배포대상 관리
  • 성능 모니터링
  • 업데이트와 롤백
  • 취약점과 라이선스 관리
  • 모델 폐기

⑤ 제조지식과 AI Agent 운영

8회차에서 살펴본 제조 온톨로지와 지식그래프는 여러 시스템과 공장의 지식을 통합한다.

Cloud 또는 중앙 플랫폼에서 다음을 관리할 수 있다.

  • 제품과 설비의 공통 의미모델
  • 승인된 작업표준과 매뉴얼
  • 전사 문제해결 사례
  • AI Agent의 정책과 도구
  • Agent의 실행이력과 평가
  • 공장별 지식의 공유와 재사용

⑥ Digital Twin과 대규모 시뮬레이션

복잡한 생산계획과 공급망, 공장 전체의 Digital Twin은 높은 연산량을 요구할 수 있다.

중앙에서 여러 시나리오를 비교한 뒤 현장에 최적화된 정책과 계획을 전달할 수 있다.

⑦ 전사 거버넌스와 감사

  • 누가 어떤 모델을 승인했는가
  • 어느 공장과 설비에 배포했는가
  • 모델별 성능과 오류는 어떠한가
  • 어떤 자동실행 권한을 가졌는가
  • 문제발생 시 어떤 버전이 사용됐는가

NIST의 Cloud-enabled Prognosis 연구는 제조설비의 상태정보를 공간적으로 연결하고 Cloud 자원을 이용해 예지와 자원배분, 정비계획과 잔여수명 분석을 지원할 수 있는 가능성과 과제를 다룬다. NIST, Cloud-Enabled Prognosis for Manufacturing

Cloud AI의 가치는 Edge보다 더 똑똑한 판단을 하는 데만 있지 않다.

여러 현장의 데이터를 모아 공통의 모델과 지식을 만들고, 이를 다시 각 Edge에 배포해 전체 제조조직의 판단수준을 높이는 것에 있다.


5. Edge와 Cloud는 데이터와 모델을 어떻게 나누는가

Edge와 Cloud를 함께 사용하려면 어느 데이터를 어디에 저장하고, 어떤 모델을 어디에서 실행할지 정해야 한다.

모든 원본데이터를 중앙에 전송하거나 모든 데이터를 현장에만 보관하는 방식은 모두 한계가 있다.

① 데이터의 역할을 구분한다

Edge에 유지할 데이터

  • 실시간 센서 데이터
  • 고해상도 원본영상
  • 단기 생산상태
  • 설비별 제어변수
  • 통신단절 중 임시 데이터
  • 외부반출 제한정보

Cloud에 전송할 데이터

  • 생산과 품질 KPI
  • 이상구간 데이터
  • 대표 불량영상
  • 모델의 판정결과
  • 설비상태 요약
  • 학습에 필요한 선별 데이터
  • 모델 성능과 오류정보

양쪽에서 관리할 데이터

  • 제품과 설비 기준정보
  • 모델버전
  • 품질기준
  • 작업규칙
  • 승인된 설정범위
  • 보안정책
  • 데이터와 모델의 시간정보

② 데이터의 흐름을 설계한다

정상운전 중에는 모든 고주파 데이터를 Cloud로 보낼 필요가 없다.

Edge에서 전처리와 특징추출, 이벤트 탐지를 수행하고 필요한 정보만 전송할 수 있다.

예를 들어 진동데이터를 초당 수만 건 수집한다면 다음과 같이 처리할 수 있다.

Edge

  • 원시 진동신호 수집
  • 노이즈 제거
  • FFT와 특징추출
  • 이상점수 계산
  • 이상구간 원본 보존
  • 즉시 알람

Cloud

  • 설비별 특징 추세 분석
  • 여러 설비의 패턴 비교
  • 고장사례와 정비이력 연결
  • 예측모델 재학습
  • 새로운 모델 배포

③ 학습과 추론을 구분한다

일반적으로 대규모 학습은 Cloud가 유리하고 빠른 추론은 Edge가 유리하다.

그러나 모든 경우가 같은 것은 아니다.

보안과 데이터 반출제한이 강하면 학습도 공장 내부에서 수행할 수 있다. 반대로 응답시간이 중요하지 않은 업무는 Cloud에서 추론할 수 있다.

④ 모델의 크기와 성능을 조정한다

Cloud에서 학습한 대규모 모델을 Edge에 그대로 배포하기 어려울 수 있다.

다음과 같은 방법으로 모델을 경량화할 수 있다.

  • Quantization
  • Pruning
  • Knowledge Distillation
  • 입력해상도와 특징 수 조정
  • 모델구조 단순화
  • Edge 가속기 최적화

다만 모델을 줄이면 정확도와 일반화 성능이 달라질 수 있으므로 경량화 이후 별도의 검증이 필요하다.

⑤ 판단권한을 구분한다

Edge의 판단

  • 즉시 이상감지
  • 제품별 품질판정
  • 제한된 공정조건 보정
  • 통신장애 시 안전상태 유지
  • 현장 작업자 알림

Cloud의 판단

  • 모델 재학습과 승인
  • 생산계획 최적화
  • 공장 간 작업배분
  • 장기 정비전략
  • 전사 품질과 공급망 분석

공동 판단

  • Cloud가 정책과 모델을 제공한다.
  • Edge가 현재상태에 맞게 실행한다.
  • Edge가 결과와 예외를 Cloud에 전달한다.
  • Cloud가 여러 현장의 결과로 모델을 개선한다.

Edge–Cloud 구조의 핵심은 데이터를 어디에 많이 저장하는가가 아니다.

현장에서 필요한 판단은 중단 없이 수행하고, 현장의 경험은 중앙에서 학습한 뒤 다시 전체 현장에 확산시키는 순환구조를 만드는 것이다.


6. 통신이 끊겨도 공장은 어떻게 안전하게 운영되는가

자율제조 시스템이 Cloud와 연결되면 통신장애를 반드시 가정해야 한다.

외부회선과 네트워크 장비, Cloud 서비스에는 장애가 발생할 수 있다.

계획정비와 보안사고, 설정오류로 연결이 중단될 수도 있다.

따라서 통신이 정상일 때만 작동하는 자율제조 구조는 운영시스템으로 보기 어렵다.

① 기본제어는 현장에 유지한다

설비의 기본운전과 안전기능은 PLC와 모션컨트롤러, 안전제어시스템에서 수행한다.

Cloud 연결이 끊겨도 다음의 기능은 유지되어야 한다.

  • 설비 기본운전
  • 인터록
  • 비상정지
  • 안전정지
  • 온도와 압력의 보호제어
  • 수동운전 전환

AI가 이러한 기능을 대신하도록 설계해서는 안 된다.

② 로컬 AI 기능을 구분한다

통신이 없어도 계속해야 하는 AI 기능을 Edge에 유지한다.

  • 비전검사
  • 설비 이상탐지
  • 현장 알람
  • 제한된 품질예측
  • 로컬 작업안내

③ Cloud 의존 기능을 중지하거나 제한한다

Cloud 연결이 필요한 기능은 장애 시 사전에 정한 방식으로 전환한다.

  • 새로운 생산계획 수신 중단
  • 모델 업데이트 중단
  • 전사 최적화 대신 기존 계획 유지
  • 자동발주 대신 담당자 확인
  • 중앙 AI Agent의 실행 중지

④ 마지막으로 검증된 상태를 사용한다

Edge에는 마지막으로 승인된 모델과 정책, 작업규칙을 보관한다.

다만 오래된 정책을 무기한 사용해서는 안 된다.

유효기간과 사용 가능한 조건을 정하고 이를 벗어나면 수동운영으로 전환한다.

⑤ 데이터를 임시 저장한다

통신이 끊긴 동안 발생한 생산과 품질, 설비데이터를 Edge에 저장한다.

통신이 복구되면 시간순서와 중복 여부를 확인한 뒤 중앙과 동기화한다.

⑥ 명령 충돌을 방지한다

통신이 복구된 뒤 Cloud의 이전 명령이 뒤늦게 실행되면 위험할 수 있다.

모든 명령에는 다음이 포함되어야 한다.

  • 명령 생성시간
  • 유효기간
  • 대상설비와 상태
  • 모델과 정책버전
  • 승인정보
  • 중복실행 방지번호

⑦ 안전한 저하운전 상태를 정의한다

통신장애 시 완전정지할 것인지, 생산속도를 낮출 것인지, 일부 제품만 생산할 것인지 정해야 한다.

이를 Fail-safe 또는 Graceful Degradation 관점에서 설계해야 한다.

예를 들면 다음과 같다.

장애상황기본 대응
Cloud 분석 연결 중단Edge의 기존 모델로 운전
중앙 생산계획 수신 중단마지막 승인계획 유지
모델 유효기간 초과AI 자동실행 중지
Edge Server 장애PLC 기본제어와 수동운영 전환
데이터 동기화 실패변경작업 보류 및 담당자 확인
품질판정 불가제품 격리 또는 생산중지

자율제조의 연속성은 모든 기능이 항상 작동하는 데 있지 않다.

일부 기능에 장애가 발생해도 안전에 중요한 기능을 유지하고, 위험한 자동실행은 중단하며, 사람이 통제할 수 있는 상태로 전환하는 것에 있다.


7. AI 모델은 Edge에 어떻게 배포하고 관리하는가

AI 모델은 한 번 설치한 뒤 계속 사용하는 소프트웨어가 아니다.

제품과 원재료, 조명과 카메라, 설비상태가 바뀌면 모델의 성능도 달라질 수 있다.

여러 Edge에 배포된 모델을 개별적으로 관리하면 어느 설비가 어떤 모델을 사용하는지 확인하기 어려워진다.

따라서 Edge AI에는 모델의 개발과 배포, 감시와 재학습을 관리하는 운영체계가 필요하다.

① 모델 등록

다음의 정보를 중앙 모델 저장소에 기록한다.

  • 모델명과 버전
  • 개발자와 책임부서
  • 학습데이터 범위
  • 대상제품과 설비
  • 입력과 출력 형식
  • 성능지표
  • 제한조건
  • 승인상태
  • 보안검사 결과

② 운영조건별 검증

Cloud에서 정확도가 높았다는 이유만으로 Edge에 배포해서는 안 된다.

실제 카메라와 센서, Edge 하드웨어에서 다음을 확인해야 한다.

  • 추론시간
  • 메모리와 CPU·GPU 사용량
  • 온도와 전력
  • 장시간 운영 안정성
  • 제품별 정확도
  • 오탐과 미탐
  • 네트워크 단절 시 동작
  • 기존 제어시스템과의 연결

③ 승인과 배포

검증된 모델만 지정된 Edge에 배포한다.

모든 공장과 설비에 동시에 배포하기보다 소수 장비에서 먼저 운영하는 방식이 안전하다.

④ Shadow Mode

새 모델이 판정은 수행하지만 실제 설비에는 반영하지 않도록 한다.

기존 모델과 새 모델의 결과, 작업자의 판정을 비교한다.

⑤ 단계적 전환

  • 시험설비에 배포한다.
  • 일부 제품에 적용한다.
  • 작업자 승인 아래 사용한다.
  • 성과가 확인되면 적용범위를 확대한다.
  • 충분히 검증된 판단만 자동실행한다.

⑥ 성능 모니터링

Edge는 다음의 정보를 중앙에 전달한다.

  • 추론 횟수
  • 처리시간
  • 모델의 신뢰도
  • 오탐과 미탐
  • 작업자의 수정
  • 입력데이터 변화
  • 시스템 자원사용량
  • 장애와 재시작
  • 모델버전

⑦ Drift 감지

제품과 환경의 변화로 입력데이터의 분포와 모델성능이 달라지는지 확인한다.

  • 신제품 투입
  • 카메라와 조명 변경
  • 설비부품 교체
  • 원재료 공급업체 변경
  • 계절과 온습도 변화
  • 작업조건 변경

⑧ 롤백

새 모델에서 문제가 발생하면 이전에 검증된 버전으로 복원할 수 있어야 한다.

모델뿐 아니라 전처리 로직과 설정값, 실행프로그램을 함께 관리해야 한다.

⑨ 재학습과 재승인

Edge에서 수집한 오류사례와 새로운 데이터를 중앙에서 검토하고 모델을 재학습한다.

재학습한 모델은 새로운 모델로 보고 다시 검증과 승인절차를 거쳐야 한다.

전체 흐름은 다음과 같다.

현장 데이터와 오류사례 수집

Cloud에서 데이터 검토와 모델 학습

성능·안전·보안 검증

모델 승인과 서명

선별된 Edge에 시험배포

Shadow Mode와 현장검증

운영배포

성능과 Drift 모니터링

문제발생 시 롤백

이러한 과정을 일반적으로 MLOps 또는 Edge MLOps의 범위에서 다룬다.

그러나 도구를 도입하는 것만으로 운영체계가 만들어지는 것은 아니다.

누가 모델을 개발하고, 누가 승인하며, 어느 조건에서 배포·중단·폐기할지를 조직적으로 정의해야 한다.


8. Edge–Cloud 연결에는 어떤 보안이 필요한가

Edge AI를 설치하면 기존 OT와 외부 Cloud 사이에 새로운 연결경로가 만들어진다.

Edge 장치는 PLC와 센서, 카메라에 접근하면서 동시에 중앙 서버와 통신할 수 있다.

따라서 잘못 구성된 Edge는 IT와 OT 사이의 공격경로가 될 수 있다.

보안은 Edge 장비에 백신을 설치하는 수준으로 해결되지 않는다.

① 네트워크 구역과 통신경로를 분리한다

  • 설비제어망
  • 생산운영망
  • Edge AI 구역
  • 산업 DMZ
  • 기업 IT망
  • Cloud 연결구역

Edge가 모든 구역에 자유롭게 접근하지 않도록 한다.

필요한 데이터와 명령만 정해진 경로로 전달해야 한다.

② 기본 통신방향을 제한한다

가능하면 Edge가 중앙으로 필요한 데이터를 전송하고, 중앙에서 OT 내부로 직접 접속하는 구조를 최소화한다.

Cloud의 명령도 Edge의 검증계층과 승인절차를 거쳐야 한다.

③ 장치와 소프트웨어의 신원을 확인한다

  • 장치별 인증서
  • 상호인증
  • 안전한 부팅
  • 서명된 소프트웨어와 모델
  • 장치 무결성 확인
  • 만료된 자격증명 폐기

④ 최소권한을 적용한다

비전검사 Edge가 생산계획을 변경하거나 PLC 프로그램을 수정할 권한을 가질 필요는 없다.

데이터와 도구, 설비별로 권한을 세분화해야 한다.

⑤ 데이터와 명령을 보호한다

  • 전송구간 암호화
  • 저장데이터 암호화
  • 명령의 출처와 무결성 확인
  • 재전송 공격 방지
  • 중요정보의 마스킹과 익명화
  • 데이터 보존기간 관리

⑥ 모델을 보호한다

AI 모델은 기업의 제조지식과 학습데이터를 포함한 자산이다.

  • 모델 파일 암호화
  • 복제와 유출 방지
  • 승인되지 않은 모델 실행차단
  • 모델 변조 확인
  • 악성 입력과 적대적 공격 감시
  • 오픈소스 구성요소와 취약점 관리

⑦ 패치와 업데이트를 통제한다

Edge 소프트웨어를 업데이트할 때 생산이 중단되거나 기존 설비와 호환성 문제가 발생할 수 있다.

시험환경에서 검증하고 계획된 시간에 배포해야 한다.

문제가 생기면 이전 버전으로 복원할 수 있어야 한다.

⑧ 보안사건과 안전영향을 함께 본다

AI 모델이나 Edge 장치가 공격받으면 잘못된 품질판정과 설비명령으로 이어질 수 있다.

따라서 보안사건의 영향을 정보유출뿐 아니라 다음의 관점에서 평가해야 한다.

  • 제품품질
  • 설비가용성
  • 작업자 안전
  • 환경
  • 생산과 납기

ISA/IEC 62443 시리즈는 산업자동화·제어시스템의 수명주기 전반에 걸친 보안과 이해관계자의 공동책임, 위험기반 보호를 다룬다. 2024년 개정된 ANSI/ISA-62443-2-1은 자산소유자의 IACS 보안프로그램을 수립·운영하고 지속해서 개선하기 위한 요구사항과 성숙도 모델을 제시한다. ISA/IEC 62443 시리즈, ANSI/ISA-62443-2-1-2024 개정 안내

ISA와 ISASecure의 IIoT 보안자료도 Cloud와 Edge-Cloud 기능을 산업제어환경에 적용할 때 ISA/IEC 62443 기반의 역할과 서비스, 적합성 검토가 필요하다고 설명한다. ISA, IIoT System Implementation and Certification

Edge–Cloud 보안의 목표는 연결을 모두 차단하는 것이 아니다.

생산에 필요한 연결만 허용하고, 연결된 주체와 명령을 확인하며, 침해가 발생해도 OT 전체로 확산되지 않도록 만드는 것이다.


9. 현실적인 Edge–Cloud 제조 AI 구축방법

Edge–Cloud 구조를 구축한다고 처음부터 모든 설비의 데이터를 중앙에 연결할 필요는 없다.

하나의 제조문제와 하나의 생산라인을 선택하고, 현장판단과 중앙학습의 순환구조를 만드는 것이 현실적이다.

예를 들어 사출성형과 비전검사 라인의 불량을 줄이는 사업을 다음과 같이 추진할 수 있다.

① 문제와 목표를 정의한다

“비전검사의 미검출을 줄이고, 공정조건과 검사결과를 연결해 불량발생을 조기에 예측한다.”

목표 KPI를 정한다.

  • 미검출률
  • 오검출률
  • 불량률
  • 판정시간
  • 검사중단시간
  • 데이터 전송량
  • 모델 업데이트 소요시간

② 응답시간과 연속성을 정한다

제품의 판정결과가 몇 밀리초 또는 몇 초 안에 나와야 하는지 정한다.

외부통신이 끊겼을 때도 비전검사를 계속해야 하는지 확인한다.

③ Edge와 Cloud의 역할을 구분한다

Edge

  • 카메라 영상 수집
  • 영상 전처리
  • 제품별 불량판정
  • 불량품 배출신호
  • 원본영상 임시저장
  • 통신장애 시 로컬운영

Cloud 또는 중앙 플랫폼

  • 불량영상과 정상샘플 관리
  • 모델 학습과 성능비교
  • 제품별 모델 관리
  • 여러 라인의 성능분석
  • 모델 승인과 배포
  • 장기 품질추세 분석

④ 기존 제어시스템과의 경계를 정한다

AI는 불량 가능성을 판정한다.

PLC는 센서와 생산위치를 확인하고 배출장치를 제어한다.

AI가 응답하지 않거나 신뢰도가 낮으면 제품을 별도로 격리하도록 한다.

⑤ 최소 데이터부터 연결한다

  • 제품과 작업지시
  • 촬영시간
  • 카메라와 라인
  • AI 판정결과
  • 검사자의 최종판정
  • 불량유형
  • 모델버전

공정조건과 원재료 LOT는 단계적으로 연결한다.

⑥ Edge에서 기준모델을 운영한다

첫 번째 모델은 실제 실행 없이 Shadow Mode로 운영한다.

작업자와 기존 검사장비의 결과를 비교한다.

⑦ 오류사례를 중앙에 축적한다

  • AI가 놓친 불량
  • 정상을 불량으로 판단한 사례
  • 새로운 불량유형
  • 조명과 위치 변화
  • 작업자가 판정을 수정한 사례

⑧ Cloud에서 모델을 개선한다

여러 기간과 제품의 데이터를 이용해 재학습하고 기존 모델과 성능을 비교한다.

평균 정확도뿐 아니라 중요한 불량유형의 미검출을 별도로 평가한다.

⑨ 단계적으로 배포한다

  • 시험용 Edge에 배포
  • 일부 제품에 적용
  • 작업자 승인 아래 사용
  • 기준을 만족하면 자동판정
  • 문제가 발생하면 이전 모델로 롤백

⑩ 운영성과를 확인한다

기술적 성능뿐 아니라 실제 제조성과를 비교한다.

  • 불량유출이 감소했는가
  • 불필요한 재검사가 줄었는가
  • 판정속도가 생산속도를 만족하는가
  • 통신장애에도 검사가 유지되는가
  • 모델관리 업무가 표준화됐는가
  • 운영비용이 절감됐는가

이 구조가 안정되면 예지보전과 공정조건 최적화, 에너지와 생산계획으로 확대할 수 있다.

현실적인 구축순서는 다음과 같다.

제조문제와 응답시간 정의

Edge와 Cloud 역할분담

최소 데이터 연결

Edge 추론과 로컬운영

Cloud 학습과 중앙관리

Shadow Mode 검증

승인된 모델 배포

성능·보안·장애 모니터링

현장결과를 이용한 재학습

적용범위 확대

중요한 것은 Edge 장비와 Cloud 서비스를 먼저 구매하는 것이 아니다.

하나의 제조업무에서 현장의 빠른 판단과 중앙의 학습이 반복되는 운영순환을 먼저 설계하는 것이다.


10. 경영진은 AI의 위치보다 무엇을 확인해야 하는가

Edge AI와 Cloud AI 사업을 보고받으면 장비의 성능과 서버규모, 네트워크 속도에 관심을 두기 쉽다.

그러나 기술사양만으로 자율제조의 성과와 안정성을 판단할 수는 없다.

다음과 같은 질문이 필요하다.

첫째, 어떤 제조판단을 Edge에서 수행하는가.

빠른 응답과 통신독립성이 실제로 필요한 업무인지 확인해야 한다.

둘째, 어떤 기능을 Cloud에서 수행하는가.

대규모 학습과 장기분석, 다공장 최적화와 중앙 모델관리처럼 Cloud의 장점이 필요한지 확인해야 한다.

셋째, 판단에 필요한 응답시간은 얼마인가.

“실시간”이라는 모호한 표현 대신 업무별 허용지연시간을 정해야 한다.

넷째, 외부통신이 끊기면 어떤 기능이 유지되는가.

설비운전과 안전, 품질검사와 생산계획이 어떤 상태로 전환되는지 확인해야 한다.

다섯째, 어떤 데이터를 현장에 남기고 어떤 데이터를 중앙으로 보내는가.

원본영상과 공정조건, 고객정보와 작업자 데이터의 보호정책이 필요하다.

여섯째, Edge에 배포된 모델은 누가 승인하고 관리하는가.

모델버전과 적용설비, 유효기간과 롤백 절차를 확인해야 한다.

일곱째, 모델의 성능저하를 어떻게 발견하는가.

제품과 환경, 설비가 변경될 때 정확도와 처리성능을 지속해서 감시해야 한다.

여덟째, AI와 기존 제어시스템의 경계는 명확한가.

PLC와 안전시스템이 담당하는 기능을 AI가 임의로 우회하지 않아야 한다.

아홉째, Edge와 Cloud의 보안책임은 누구에게 있는가.

설비담당자와 IT, 보안부서, 공급업체와 Cloud 사업자의 역할을 구분해야 한다.

열째, Edge–Cloud 구조가 실제 제조성과를 개선했는가.

다음의 KPI를 확인해야 한다.

  • 판정과 대응시간
  • 불량과 미검출
  • 비계획 정지
  • 네트워크 사용량
  • Cloud 전송·저장비용
  • 통신장애 중 운영시간
  • 모델 배포와 복구시간
  • 보안사건과 운영장애
  • AI 도입 전후의 생산성
  • 현장 작업자의 업무부담

경영진이 결정해야 할 것은 Edge와 Cloud 중 어느 기술이 더 우수한가가 아니다.

업무별로 필요한 속도와 안정성, 데이터와 위험에 맞게 AI의 역할이 배치되어 있는가이다.


마치며

자율제조에서 모든 AI를 Cloud에 두는 것은 현실적이지 않다.

현장에는 수십 밀리초 또는 수초 안에 판단해야 하는 업무가 있다.

고해상도 영상과 고주파 센서데이터를 모두 외부로 전송하면 네트워크와 저장비용이 증가한다.

통신이 끊겨도 품질검사와 이상탐지, 기본 생산기능을 유지해야 한다.

그렇다고 모든 AI를 Edge에 설치하는 것도 효율적이지 않다.

복잡한 모델을 학습하고 여러 공장과 장기간의 데이터를 분석하려면 중앙의 컴퓨팅 자원과 통합된 데이터가 필요하다.

수많은 Edge에 배포된 모델과 정책을 일관되게 관리할 중앙체계도 필요하다.

결국 자율제조의 AI 구조는 다음과 같이 역할을 나누어야 한다.

Device는 가장 가까운 곳에서 감지하고 반응한다.

Machine Edge는 개별 설비와 제조 셀의 상태를 판단한다.

Factory Edge는 생산라인과 공장 내부의 데이터를 연결한다.

Cloud는 여러 공장과 장기간의 데이터를 학습한다.

Cloud에서 개선한 모델과 지식을 다시 Edge에 배포한다.

Edge는 현장의 실행결과와 예외를 중앙으로 전달한다.

중앙은 그 경험을 이용해 다음 모델과 정책을 개선한다.

이 흐름이 연결될 때 Edge와 Cloud는 하나의 제조지능으로 작동한다.

중요한 것은 모든 데이터를 실시간으로 중앙에 모으는 것이 아니다.

모든 설비에 고성능 Edge 장비를 설치하는 것도 아니다.

판단이 필요한 시간과 장소에서 필요한 AI가 작동하고, 현장의 경험이 중앙에서 학습된 뒤 다시 전체 현장에 확산되도록 만드는 것이 중요하다.

Edge AI는 현장을 Cloud로부터 독립시키기 위한 기술만은 아니다.

Cloud AI도 현장을 중앙에 종속시키기 위한 기술이 아니다.

Edge는 현장에 필요한 속도와 연속성을 제공하고, Cloud는 개별 현장에서 만들기 어려운 규모의 학습과 최적화를 제공한다.

자율제조의 경쟁력은 AI를 어디에 설치했는가로 결정되지 않는다.

현장의 빠른 판단과 중앙의 장기학습을 얼마나 안정적이고 안전하게 연결할 수 있는가.

바로 이것이 자율제조가 Edge AI와 Cloud AI를 함께 사용해야 하는 이유다.

다음 글에서는 Edge와 Cloud에 배포된 수많은 AI 모델을 어떻게 지속해서 관리해야 하는지 살펴보고자 한다.

정확도가 높았던 모델도 제품과 설비, 원재료와 환경이 바뀌면 성능이 떨어질 수 있다. 누가 이를 발견하고 다시 학습하며, 어느 시점에 자동실행을 중단해야 할까.

[자율제조 시리즈 ⑩] 제조 AI 모델은 왜 구축보다 운영이 더 어려운가?


참고자료