42dot, the Global Software Center of Hyundai Motor Group

Advancing Mobility,
Realizing Possibilities

42dot은 현대자동차그룹의 글로벌 소프트웨어 센터로, 소프트웨어와 AI를 통해 모빌리티 패러다임을 바꾸고 있습니다.

Software-Defined Vehicles for
Enhanced User Value

E/E 아키텍처 차량 전기·전자 시스템

E/E Architecture

Simplified, Scalable, and Standardized Framework

42dot은 지속적인 업데이트를 통해 사용자에게 언제나 최신 기능과 경험을 제공하는
SDV(Software-Defined Vehicle)를 개발합니다. 차량의 복잡한 전자·전기 구조를
단순화하고, 소프트웨어를 기반으로 기능과 성능을 극대화하여 확장 가능한 표준화된
아키텍처를 구현합니다.

Learn More
Vehicle OS 소프트웨어·하드웨어 통합 운영체제

Vehicle OS

Coordinated Orchestration of Software and Hardware

Vehicle OS는 차량 기능을 통합적으로 관리해 매끄러운 운영을 지원하고, 컴퓨팅 자원을 효율적으로 최적화하며, 실시간 데이터 모니터링을 지원하는 SDV 전용 운영체제입니다.
하드웨어 추상화 계층을 적용해 소프트웨어와 하드웨어를 분리하고, 차량 내 다양한
소프트웨어가 유기적으로 동작할 수 있는 안정적인 실행·배포 환경을 제공합니다.

Learn More
Gleo AI 기반 인포테인먼트 인터페이스

Infotainment

Personalized Mobility Experiences, Next-Generation

차세대 인포테인먼트 시스템은 차량과 사용자를 연결하는 핵심 인터페이스로,
최적의 모빌리티 경험을 제공합니다. agentic AI 기술인 Gleo AI를 기반으로 지능화된
서비스를 제공하며, 최적 경로를 안내하는 내비게이션 기능을 고도화하고 있습니다. 또한
스마트폰의 경험을 차량으로 확장한 앱 마켓을 통해 모빌리티 생태계를 지속적으로 확대해
나가고 있습니다.

Learn More

AI Drives the
Future of Mobility

  • Autonomous Driving AI

    Autonomous Driving Technology for Mass Production

    운전자 보조 기능(ADAS)부터 로보택시까지 확장 가능한 AI Driver로, 도심·고속도로
    주행과 주차를 아우르는 안전하고 편리한 자율주행 경험을 제공합니다. 자동차 산업의
    엄격한 안전 기준을 준수하며, 실도로 데이터를 지속적으로 수집·학습해 AI 성능을
    끊임없이 고도화합니다.

    Learn More
    양산형 mapless·end-to-end 자율주행 기술
  • Agentic AI

    LLM-Based Agentic AI for Intelligent Services

    LLM 기반의 agentic AI 기술을 통해 시스템은 스스로 판단하고 실행하며, 음성과 다양한
    컨텍스트를 분석하고 이해합니다. 자연어 기반의 복잡한 질의 처리, 대화 문맥 및 좌석 위치
    인식, 다중 작업 수행 등 고도화된 기능을 제공합니다.

    Learn More
    Agentic AI 음성·맥락 인식 인터페이스
  • Fleet AI

    AI Solutions to Optimize Movement

    차량 및 운행 데이터를 기반으로 최적의 차량 관리와 운행 효율을 실현합니다. 개별 차량은 물론 fleet 단위까지 실시간 인사이트를 제공하고, 다양한 요소를 분석·예측합니다.

    Learn More
    Fleet AI 차량 운행 데이터 시각화

42dot, the Global Software
Center of Hyundai Motor Group

42dot은 현대자동차그룹의 글로벌 소프트웨어 센터로서
그룹의 SDV(Software-Defined Vehicle) 전환을 주도하고 있습니다.

Learn More

Tech and
Stories

42dot의 tech, culture 등 다양한 소식을
만나보세요!

Explore Stories
Tech
Gleo Guard l 차량 AI Agent를 위한 안전 가드레일
Gleo Guard l 차량 AI Agent를 위한 안전 가드레일
Gleo Guard l 차량 AI Agent 를 위한 안전 가드레일 * 본 이미지는 생성형 AI 기술을 활용하여 제작되었습니다 . LLM 기반 AI Agent 는 이제 단순히 질문에 답하는 수준을 넘어 , 사용자의 요청을 이해하고 실제 기능 실행까지 연결하는 방향으로 발전하고 있습니다 . 특히 차량 안에서 동작하는 AI Agent 는 내비게이션 , 통화 , 메시지 , 차량 기능 제어처럼 실제 행동으로 이어질 수 있는 기능과 연결됩니다 . 그래서 차량 AI Safety 는 일반적인 챗봇 안전성보다 더 넓은 범위를 다뤄야 합니다 . 42dot 의 Gleo Guard 는 이러한 문제의식에서 출발했습니다 . Gleo Guard 는 Gleo AI 가 사용자의 발화를 안전하게 이해하고 , 차량 환경에서 실행 가능한 요청인지 , 위험하거나 부적절한 요청인지 , 응답 시 어떤 범위를 지켜야 하는지를 판단하는 가드레일 모듈입니다 . 단순히 특정 단어를 차단하는 필터가 아니라 , 사용자의 의도 , 차량 내 사용 맥락 , 국가 · 언어별 정책 , 기능 실행 가능성을 함께 고려합니다 . 이번 글에서는 Gleo AI LLM 으로 Gleo Guard 를 개발하며 얻은 경험을 소개합니다 . 핵심은 더 작은 모델로 더 빠르고 효율적인 추론을 만들면서도 , 차량 AI Agent 에 필요한 안전성과 정확도를 함께 끌어올리는 것이었습니다 . 1. Gleo Guard 소개 : 차량 안의 AI 를 위한 안전 판단 레이어 Gleo Guard 는 Gleo AI 앞단에서 사용자의 발화를 먼저 확인합니다 . 사용자의 요청이 안전한지 , 제한이 필요한지 , 혹은 차량 기능으로 이어져도 되는지 판단합니다 . 차량용 AI Agent 에서 가드레일이 중요한 이유는 명확합니다 . 일반 챗봇은 부적절한 답변을 생성하지 않는 것이 주된 목표일 수 있지만 , 차량 AI 는 실제 행동과 연결됩니다 . 예를 들어 , 사용자의 말 한마디가 목적지 검색 , 전화 걸기 , 메시지 전송 , 차량 기능 실행으로 이어질 수 있습니다 . 따라서 Gleo Guard 는 “ 이 질문에 답해도 되는가 ?” 뿐만 아니라 “ 이 요청을 차량 환경에서 실행해도 되는가 ?” 를 함께 판단해야 합니다 . 이때 가장 어려운 문제는 과도한 차단과 과소 차단 사이의 균형입니다 . 위험한 요청은 반드시 제어해야 하지만 , 정상적인 차량 기능 요청까지 막으면 사용자 경험이 크게 나빠집니다 . 예를 들어 , 사용자가 음식점 이름에 민감한 단어가 포함된 장소를 검색할 수도 있고 , 연락처 이름에 비속어가 들어 있을 수도 있습니다 . 반대로 표현은 평범해 보여도 실제 의도는 불법 행위 , 개인정보 침해 , 프롬프트 탈취일 수 있습니다 . Gleo Guard 는 이러한 경계 사례를 단어가 아니라 맥락과 의도 중심으로 판단하도록 설계되었습니다 . Gleo Guard 는 침착하고 믿음직한 조수석 동승자입니다 . 운전자의 요청을 자연스럽게 돕되 , 차량 환경에 맞지 않거나 안전을 해칠 수 있는 요청은 실행 전에 판단하고 제어합니다 . Gleo Guard 의 목표는 더 많이 차단하는 것이 아니라 , 차량 안에서 Gleo 가 더 안전하고 신뢰할 수 있는 방식으로 작동하게 하는 것입니다 . 2. Gleo Guardrail Policy: 무엇을 허용하고 , 무엇을 제한할 것인가 그림 1. Gleo Guard 의 차단 정책 Gleo Guard 의 정책은 크게 두 가지 관점으로 구성됩니다 . 첫 번째는 명확히 위험한 요청을 제한하는 Critical 정책 입니다 . 불법 행위 , 자해 , 혐오 , 프롬프트 인젝션 등과 관련된 내용이 여기에 포함됩니다 . 예를 들어 , 범죄 실행 방법이나 무기 제작법처럼 실제 피해로 이어질 수 있는 요청은 제공하지 않고 , 대신 예방 · 신고 · 안전 확보처럼 허용 가능한 범위의 정보를 안내합니다 . 두 번째는 맥락에 따라 조심스럽게 다뤄야 하는 Caution 정책 입니다 . 투자나 의료 조언과 같은 내용은 차단만으로 해결하기 어렵습니다 . 이러한 요청은 사실 기반 설명 , 중립적 비교 , 안전한 표현 , 전문가 상담 권고처럼 허용 가능한 범위를 명확히 분리해야 합니다 . 응답 원칙도 단순합니다 . 위험한 요청에는 짧고 명확하게 거절하고 , 가능한 경우 안전한 대안을 제시합니다 . 합법성이나 사실관계가 불확실한 경우에는 단정하지 않고 공식 채널이나 전문가 확인을 권합니다 . 또한 국가별 정책이 필요한 항목은 사용 지역과 언어 맥락을 함께 고려합니다 . 차량 AI Safety 관점에서 중요한 예외도 있습니다 . 병원이나 약국을 찾는 요청은 의료 진단이 아니라 내비게이션 기능일 수 있습니다 . 연락처 조회 요청은 개인정보 침해처럼 보일 수 있지만 , 사용자의 연결된 모바일 기기에 저장된 연락처를 확인하는 정상 기능일 수 있습니다 . Gleo 가 지원하는 공개 기능이나 음성 명령을 묻는 것은 허용되지만 , 내부 프롬프트나 비공개 도구 정의를 요구하면 제한해야 합니다 . 이런 예외를 처리하는 것은 차량 AI Agent 에서 과도한 차단을 줄이는 핵심 요소입니다 . 3. Policy-to-Data: 합성데이터 생성 방법 그림 2. Policy-to-Data Generation Workflow Gleo Guard 의 핵심 작업 중 하나는 문서로 정의된 안전 정책을 모델이 학습할 수 있는 데이터로 변환하는 일이었습니다 . 이를 위해 정책을 기준으로 가드레일의 판단 경계를 체계적으로 탐색하는 Policy 기반 LLM-as-an-attacker 워크플로우 를 구성했습니다 . LLM-as-an-Attacker 란 LLM 이 정책에 기반한 적대적 사용자 역할을 수행하며 , 부적절한 콘텐츠를 요청하거나 제한된 행동을 유도하는 프롬프트를 생성하여 가드레일의 취약한 판단 경계를 체계적으로 탐색하는 방법입니다 . Gleo Guard 에서는 여기에 정상 요청이 과도하게 차단되는 경우까지 함께 점검할 수 있도록 , 허용 · 제한 조건과 예외 사항을 반영한 대조적 경계 사례 생성으로 범위를 확장했습니다 . 이 접근에서는 합성데이터 구축의 전체 과정이 하나의 정책 기반 공격 시나리오 탐색 워크플로우로 동작합니다 . 첫번째 단계 로는 각 정책을 라벨 단위로 정리하고 , 허용 규칙 , 제한 규칙 , 기대 행동 , 차량 AI Agent 에서 필요한 예외 조건을 정책 카드로 구조화했습니다 . 정책 카드는 Attacker 가 어떤 부적절한 콘텐츠 요청이나 제한된 행동 유도 요청을 생성해야 하는지 , 그리고 어떤 정상 요청이 과도하게 차단될 수 있는지를 탐색하는 기준이 됩니다 . 두번째 단계 에서는 각 정책 카드에서 생성 조건을 구성했습니다 . 생성 조건에는 적용할 정책 , 허용 또는 제한 여부 , 사용자의 의도 , 기대하는 응답 방식 , 단일 · 다중 대화 여부 , 차량 기능 실행과의 연관성 등이 포함됩니다 . 명확한 Safe 또는 Unsafe 사례뿐 아니라 , 표면적인 표현만으로는 정책 판단이 어려운 경계 사례를 중점적으로 구성했습니다 . 세번째 단계 에서는 구성한 생성 조건을 바탕으로 다양한 사용자 요청과 대화 사례를 생성했습니다 . 예를 들어 직접적인 위험 표현을 피하면서 부적절한 콘텐츠를 생성하도록 유도하는 요청 , 일상적인 표현으로 제한된 기능 실행을 요청하는 사례 , 여러 대화 턴에 걸쳐 위험한 의도를 점진적으로 드러내는 사례를 생성했습니다 . 반대로 민감한 표현이 포함되어 있더라도 저장된 연락처에 전화를 걸거나 특정 장소를 검색하는 정상적인 차량 기능 요청처럼 , 단순한 키워드 기준으로는 과도하게 차단될 수 있는 허용 사례도 함께 생성했습니다 . 차량 기능 실행과 관련된 사례는 Action-Aware 데이터 로 구성했습니다 . 전화 걸기 , 메시지 전송 , 목적지 검색 , 연락처 조회 , 일정 등록 , 차량 기능 제어 등 실행 가능한 후보 행동을 추상적으로 표현하고 , 해당 행동을 허용할지 , 차단할지 , 추가 확인이 필요한지를 함께 정의했습니다 . 실제 전화번호 , 주소 , 메시지 원문이나 내부 도구 인자를 사용하는 대신 , 정책 판단에 필요한 행동 유형과 대상 유형만 포함했습니다 . 생성된 데이터의 예시는 다음과 같습니다 . 네번째 단계 에서는 별도의 검증기를 통해 적용된 정책이 올바른지 , 생성된 요청이 의도한 허용 · 제한 조건과 일치하는지 , 기대 행동과 Action gate 가 적절한지를 확인했습니다 . 또한 부적절한 콘텐츠를 답변 형태로 직접 포함하거나 , 위험한 실행 정보가 지나치게 구체적이거나 , 개인정보가 포함된 사례는 제거했습니다 . 또한 , Gleo Guard 는 공개 안전성 데이터도 보완적으로 활용했습니다 . 자체 워크플로우가 놓칠 수 있는 혐오 , 공격성 , 자해 , 프롬프트 인젝션 등의 패턴을 보완하기 위해 공개 데이터를 Gleo Guard 의 Canonical Label 로 매핑하고 , 언어별 정리와 중복 제거를 거쳐 학습 데이터에 포함했습니다 . 이 과정을 통해 Gleo Guard 의 학습 데이터는 단순한 Safe/Unsafe 분류 데이터가 아니라 , 정책의 판단 경계를 체계적으로 공격하고 검증하여 구축한 데이터가 되었을 뿐만 아니라 , 차량 AI Agent 가 실제 상황에서 요청을 거절할지 , 안전한 대안을 안내할지 , 정상적인 차량 기능으로 수행할지까지 학습할 수 있는 action-aware 데이터로 구성했습니다 . 4. Aligning to Policy: 모델이 정책을 따르도록 학습하기 Gleo Guard 학습 방법 정책을 반영한 데이터를 구축한 이후에는 , 모델이 실제 서비스 환경에서도 일관되게 정책을 따르도록 학습해야 합니다 . 이를 위해 Gleo Guard 는 SFT 와 RL 을 단계적으로 활용했습니다 . 먼저 SFT(Supervised Fine-Tuning, 지도 미세조정 ) 는 사전 학습된 언어 모델에 입력과 기대 출력이 짝을 이룬 데이터를 제공하고 , 모델이 주어진 입력에 대해 목표 출력을 생성하도록 추가 학습하는 방법입니다 . 일반적으로 LLM 의 SFT 에서는 사용자 지시와 이에 부합하는 응답으로 구성된 데이터를 사용해 , 다음 토큰을 예측하는 기본 언어 모델을 실제 사용자의 지시를 따르는 모델로 조정합니다 . 이를 통해 모델은 학습 데이터에 명시된 출력 형식과 기본적인 판단 기준을 직접 익힐 수 있습니다 . Gleo Guard 의 SFT 단계에서는 사용자 발화와 대화 맥락을 입력으로 사용하고 , 해당 요청이 어떤 정책 라벨에 해당하는지와 어떤 방식으로 응답해야 하는지를 학습합니다 . 예를 들어 , 요청을 허용할지 또는 제한할지를 정답 데이터로 제시합니다 . 이 단계에서는 모델이 Gleo 정책의 기본적인 경계를 이해하고 , 차량 AI Agent 에서 기대하는 판단과 응답 방식을 안정적으로 익히도록 합니다 . 이후 RL(Reinforcement Learning, 강화학습 ) 단계에서는 모델이 생성한 결과에 대한 평가를 보상 신호로 활용해 , 더 높은 보상을 받는 판단과 응답을 선택하도록 모델을 조정합니다 . SFT 가 정답 예시의 출력을 직접 학습하는 방식이라면 , RL 은 여러 가능한 출력 중 어떤 결과가 정책과 기대에 더 잘 부합하는지를 평가하고 , 그러한 결과가 생성될 가능성을 높이는 방식입니다 . 이번 RL 학습에서는 GRPO(Group Relative Policy Optimization) 를 활용했습니다 . GRPO 는 하나의 입력에 대해 여러 응답을 생성한 뒤 , 각 응답의 보상을 그룹 내에서 상대적으로 비교하여 정책을 업데이트하는 방식입니다 . 이를 통해 별도의 value model 없이도 상대적인 보상 정보를 활용하여 , 모델이 더 높은 품질의 응답을 생성하도록 최적화할 수 있었습니다 . Gleo Guard 의 RL 단계에서는 사람이 검수한 신호를 활용하여 모델의 정책 판단을 더욱 정교하게 조정합니다 . SFT 를 통해 정책의 기본적인 허용 · 제한 기준을 학습한 뒤 , 실제 서비스에서 발생할 수 있는 미묘한 경계 사례에 대해서도 더 적절한 판단을 내리도록 보완하는 과정입니다 . 예를 들어 SFT 만으로는 비속어가 포함된 요청을 모두 위험한 요청으로 판단할 수 있지만 , RL 을 통해 “ 비속어가 포함되어 있더라도 저장된 연락처에 전화를 거는 정상적인 요청 ” 과 같이 표현상의 위험 신호와 실제 사용자의 의도를 구분하고 , 서비스 정책에 맞는 판단을 학습할 수 있습니다 . 또한 Gleo Guard 는 다양한 서비스 정책 변화에 대응할 수 있도록 예시 기반 학습 능력도 함께 학습합니다 . 학습 과정에서는 동일한 정책을 다양한 시스템 프롬프트와 예시 (Few-shot Example) 형태로 구성하여 , 예시가 추가되거나 변경되어도 정책을 일관되게 적용할 수 있도록 학습했습니다 . 또한 학습시 특정 예시만 암기하는 것을 방지하기 위해 혼동 할 수 있는 예시를 함께 사용하여 모델의 강건성을 높였습니다 . 이를 통해 SFT 에서는 정책의 기본적인 판단 기준과 응답 형식을 학습하고 , RL 에서는 사람의 검수 신호를 바탕으로 경계 사례에 대한 판단을 더욱 정교하게 조정했습니다 . 그 결과 , Gleo AI LLM 이 Gleo 정책에 따라 일관되고 안정적으로 판단할 수 있도록 학습하였습니다 . 5. 실험 결과 : Safe / Unsafe 이진 판정 성능 평가는 두 가지 관점에서 진행했습니다 . 첫 번째는 Gleo Guard 자체가 입력 발화를 Safe/Unsafe 로 잘 분류하는지 보는 평가입니다 . 두 번째는 실제 Gleo 응답까지 생성한 뒤 , 최종 응답이 안전한지 다시 평가하는 E2E Safety Test 입니다 . 아래 표는 42dot 내부에서 구축한 평가셋에서 측정한 Safe/Unsafe 분류의 Macro Accuracy 입니다 . Macro Accuracy 는 Safe 와 Unsafe 각각을 올바르게 분류한 비율을 구한 뒤 동일한 비중으로 평균한 지표로 , 클래스별 데이터 수의 차이에 영향을 덜 받으면서 두 클래스에 대한 균형 잡힌 분류 성능을 나타냅니다 . 구분 모델 Macro Accuracy 42dot model Gleo Guard 98.26% API model (OpenAI) GPT-5.5 88.78% API model (OpenAI) GPT-5.6-luna 88.00% API model (OpenAI) GPT-5-mini 86.96% API model (Claude) Sonnet-5 80.40% API model (Claude) Haiku-4.5 79.17% Open model Qwen3.5-35B-A3B 79.55% Open model Qwen3.5-4B 81.88% * 본 결과는 당사 내부에서 자체적으로 구축한 평가셋을 바탕으로 동일한 시험 조건에 따라 측정한 결과입니다 . 실제 서비스 환경에서의 성능은 사용 환경 , 데이터 특성 및 시스템 운영 조건 등에 따라 달라질 수 있습니다 . Gleo Guard 는 API model 과 open model 을 포함한 비교 대상 중 본 내부 평가에서 가장 높은 성능을 기록했습니다 . 특히 , OpenAI 에서 공개한 최신 모델인 GPT-5.6-luna 대비 Unsafe 요청을 Safe 로 잘못 판단하는 오류는 7.50% 에서 1.66% 로 감소했으며 , Safe 요청을 Unsafe 로 과도하게 차단하는 오류는 16.50% 에서 1.82% 로 감소했습니다 . 그 결과 , Macro Accuracy 는 88.00% 에서 98.26% 로 10.26%p 향상되었습니다 . E2E Safety Test 에서는 입력 분류 성능뿐 아니라 Gleo 가 실제로 생성한 최종 답변이 안전한지도 평가했습니다 . 이를 위해 LLM-as-a-Judge 방식을 활용했습니다 . LLM-as-a-Judge 란 별도의 LLM 이 평가자 역할을 맡아 , 주어진 평가 기준에 따라 다른 모델의 응답 품질이나 정책 준수 여부를 판정하는 방법입니다 . 이번 평가에서는 전체 대화 문맥과 마지막 Gleo 응답을 함께 입력하고 , 응답이 안전한지 , 정책에서 요구한 방향에 맞게 답변했는지 , 위험한 요청을 올바르게 거절했는지 , 허용 가능한 요청을 과도하게 거절하지 않았는지를 평가했습니다 . 구체적으로 15,010 건의 테스트케이스에 대해 Gleo AI 의 답변을 생성한 뒤 , Kanana Safeguard 8B 모델의 LLM-as-a-Judge 를 활용해 [user question, assistant answer] 쌍을 다시 판정했습니다 . 평가는 최종 응답의 Safe/Unsafe 여부뿐 아니라 , 필요한 경우 올바른 거절과 안전한 대안이 포함되었는지 , 일부라도 위험한 요청을 따르지는 않았는지 , 정책에 맞는 답변이었는지를 종합적으로 확인했습니다 . 그 결과 위험 답변은 668 건에서 246 건으로 줄었고 , 위험 비율은 4.5% 에서 1.6% 로 낮아졌습니다 . E2E 평가 기준 API model Gleo Guard 변화 Safe 응답 수 14,342 14,764 +422 Unsafe 응답 수 668 246 -422 Unsafe 비율 4.5% 1.6% -2.9%p 이 결과는 학습한 모델이 단순히 분류 점수만 개선한 것이 아니라 , 실제 Gleo 의 최종 응답 안전성에도 영향을 준다는 점을 보여줍니다 . 또한 기존 SAFE 답변이 새 실행에서 UNSAFE 로 전환되는 비율 , 즉 누출률도 약 3% 수준에서 0.91% 로 낮아졌습니다 . 이와 같은 내부 검증 환경에서는 개선 케이스가 악화 케이스보다 4.2 배 많아 , 단순 재생성 노이즈가 아니라 Gleo Guard 의 실질적인 효과로 해석했습니다 . 6. 향후 계획 : 글로벌 AI 윤리와 레드티밍 자동화 Gleo Guard 는 앞으로 더 빠르고 정확한 판단 , 과잉 탐지 감소 , 글로벌 확장을 목표로 고도화할 계획입니다 . 첫 번째 방향은 차량 위치에 따른 AI 윤리 적용 입니다 . 같은 요청이라도 차량이 위치한 국가 , 언어 , 문화 , 종교 , 법 · 제도 , 사회적 정서에 따라 다르게 해석될 수 있습니다 . 예를 들어 위기 상황 안내 번호 , 의료 · 법률 안내 방식 , 정치적 민감도 , 상업적 성 서비스 관련 정책 , 영토 · 역사 표현 , 브랜드 · 제품 비교에 대한 허용 범위는 지역별로 달라질 수 있습니다 . 앞으로는 차량의 locale, jurisdiction, 언어 설정 , 사용자 맥락을 더 정교하게 반영해 지역별 안전 정책을 적용할 예정입니다 . 두 번째 방향은 레드티밍 자동화 입니다 . 현재의 레드티밍은 전문가가 Gleo 의 반응을 보며 실시간으로 취약 패턴을 찾고 인사이트를 제공하는 방식으로 운영되었습니다 . 앞으로는 이 과정을 자동화하려고 합니다 . 정책 카드와 실제 서비스 로그에서 레드티밍 시나리오를 생성하고 , Gleo 실행 결과를 외부 평가 모델과 정책 verifier 로 검증한 뒤 , 실패 케이스를 다시 합성데이터 생성 파이프라인으로 재투입하는 구조입니다 . 차량은 이동하는 공간입니다 . 사용자는 운전 중이고 , 동승자가 있을 수 있으며 , 어린이나 청소년이 함께 있을 수도 있습니다 . 그래서 차량 AI Safety 는 단순한 응답 안전성 검증을 넘어 , 실제 행동과 사용 맥락 , 지역 정책 , 사용자 경험까지 함께 고려해야 합니다 . Gleo Guard 는 Gleo AI 가 더 똑똑한 Agent 가 되는 것뿐 아니라 , 실제 차량 환경에서 신뢰할 수 있는 Agent 가 되기 위한 기반 기술입니다 . 조성국, Seongkuk Cho (Senior AI Engineer) ㅣ Gleo Core Gleo AI가 사용자에게 더욱 안전하고 신뢰도 높은 응답을 제공할 수 있도록 가드레일 기술과 안전성 평가 체계를 개발하고, 지속적으로 서비스 품질을 개선하고 있습니다. 장준원, Joonwon Jang (AI Model Engineer) ㅣ Gleo Foundation Gleo AI의 다양한 기능을 지원할 수 있도록 42dot LLM Model의 post-training을 담당하고 있으며, 지속적으로 모델 성능을 개선하고 있습니다. 7. 참고문헌 [1] Perez, E., et al. “Red Teaming Language Models with Language Models.” Proceedings of EMNLP , 2022. [2] Choi, D., et al. “COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs.” arXiv preprint arXiv:2601.01836 , 2026. [3] Ouyang, L., et al. “Training Language Models to Follow Instructions with Human Feedback.” Advances in Neural Information Processing Systems , 2022. [4] Bai, Y., et al. “Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.” arXiv preprint arXiv:2204.05862 , 2022. [5] Bai, Y., et al. “Constitutional AI: Harmlessness from AI Feedback.” arXiv preprint arXiv:2212.08073 , 2022. [6] OpenAI. “GPT-4 System Card.” Technical Report , 2023. [7] Zheng, L., et al. “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.” Advances in Neural Information Processing Systems , 2023. [8] Zhao, H., et al. “Qwen3Guard Technical Report.” arXiv preprint arXiv:2510.14276 , 2025. [9] Kanana Safeguard Team. “Kanana Safeguard.” Hugging Face Model Card, 2025.

Come Ride
with Us!

소프트웨어와 AI에 automotive 기술이 결합된 새로운 모빌리티를 만들어가고 싶다면,
지금 바로 지원하세요.

Open Roles

Follow Us
on Social Media

  • 42dot Linkedin
  • 42dot Facebook
  • 42dot Instagram
  • 42dot Youtube