김성웅 프로필 사진

김성웅Sungwoong Kim

AI Developer · Physical AI / VLA · Multimodal

모델 개발을 넘어 실제 환경에서 작동하는 시스템으로 연결하는 데 흥미를 느끼는 개발자. CNN, LLM/VLM, VLA 프로젝트를 거치며 시각 이해 → 멀티모달 추론 → 로봇 행동 학습으로 경험을 확장했고, 현재는 로봇 모방학습 파이프라인을 직접 설계·개선하고 있습니다.

Emailswk5276@gmail.com Phone010-7740-3249 GitHubgithub.com/swk5276

Experience

비전스페이스 · 연구원

2025.11 — 재직 중
VLA · ACT 기반 로봇 모방학습 플랫폼 및 산업 도메인 멀티모달 AI 어시스턴트 개발

VLA · ACT 통합 로봇 모방학습 플랫폼

2025.11 — 2026.03

로봇 시연 데이터 수집부터 VLA/ACT 정책 학습 · 추론 · 평가 · 데이터 관리까지 전 과정을 통합한 End-to-End 로봇 시뮬레이션 기반 학습 플랫폼 개발.

  • MuJoCo 기반 SOARM-101 환경에서 Teleoperation과 Jacobian IK Heuristic을 결합한 이중 수집 파이프라인 설계 — 데이터 수집 속도 40% 향상.
  • LeRobot 오픈소스 커스터마이징으로 SmolVLA · ACT 정책을 연동, 데이터 수집 → 학습 → 추론 → 검증을 단일 환경에 통합 — 실험 모니터링 및 디버깅 시간 2배 단축.
  • 물체 배치 랜덤화 등 Domain Randomization 적용 및 자동 평가 파이프라인 구성으로 시뮬레이션 환경 내 Task 성공률 80% 이상 달성.
  • VLA/ACT 정책의 반복적 성능 비교를 위한 MuJoCo-WASM 기반 웹 실험 환경 구축 — 실험 운영 효율 향상.

산업 도메인 지식 기반 멀티모달 AI 어시스턴트

2025.11 — 2026.03

관련 문서(PDF · CSV · TEXT) · 이미지 · 내부 지식베이스를 통합 이해하는 멀티모달 AI 어시스턴트. LangGraph 기반 ReAct 에이전트와 Hybrid RAG를 적용한 도메인 특화 QA 시스템 구현.

  • Supervisor – Planner – Agent 3계층 상태 오케스트레이션과 Fail-safe 설계로 자유형 에이전트의 치명 오류인 무한 루프 발생 0건 달성.
  • 질의 의도에 따라 VLM(의미 해석)과 SigLIP(크로스모달 검색) 역할을 분리한 동적 라우팅 파이프라인 구축 — 불필요한 LLM 추론 방지 및 검색 Latency 단축.
  • BM25(Keyword) + FAISS(Vector) Hybrid RAG와 Reranker 적용으로 로봇 · 설비 문서 검색 정확도와 근거 기반 응답 품질 향상.
  • vLLM · Ollama 기반 Multi-Provider Gateway 자체 구축으로 On-Premise(폐쇄망) 환경 운영 안정성 확보.

Education

Microsoft · SW 인공지능 아카데미 1기

2025.02 — 2025.09
수료

인천대학교 · 임베디드시스템공학과

~ 2025.02
학사 졸업

Tech Stack

Languages
PythonC
AI
PyTorchVLAVLM LLMRAGAgent
Backend & HW
FastAPIFlaskRaspberry Pi (MPU)
Tools
GitSlackJira

Projects

VLM/LLM 멀티 에이전트 숏폼 자동 제작 서비스

2025.05 — 2025.09
멀티모달 입력 → 스토리/이미지/음성 자동 생성 앱

멀티모달 입력 데이터를 기반으로 스토리 생성 · 이미지 생성 · 음성 합성을 에이전트 단위로 수행해 숏폼 콘텐츠를 자동 제작하는 앱 서비스 개발.

  • 복수 Whisper 모델 병렬 앙상블과 LLM 기반 문맥 복원(Refiner) 로직으로 현장 노이즈 입력에서의 인식 오류 및 Snowball Effect 구조적 차단.
  • VLM 캡셔닝 기반 캐릭터 외형 데이터 추출 및 씬 메타데이터 JSON 구조화 — 다중 인물 환경에서의 시각적 일관성 확보 및 프롬프트 재현성 고도화.
  • 로컬 음성 모델을 Edge-TTS로 대체 후 에이전트 단위 모듈화 — GPU VRAM 병목 해소 및 영상 렌더링 파이프라인 확장성 확보.

CNN 기반 다색상 원단 색상 유사도 검출 시스템

2024.01 — 2024.06
졸업 프로젝트 · MPU 환경 경량 비전 시스템

MPU 환경에서 다색상 원단의 색상 유사도를 CNN으로 정량 분석해 의사결정 지표를 제공하는 시스템 개발.

  • 원단 이미지 18,000여 장 촬영 · 라벨링하여 자체 데이터셋 구축, 도메인 특화 전처리 및 증강 적용.
  • DBSCAN Clustering으로 복잡한 무늬 속 색상 자동 분류 구현.
  • VGG-16 기반 CNN을 경량화해 저사양 하드웨어에 맞게 최적화 (성능 유지, 연산량 큰 폭 감소).
  • 색상 채널 분리 후 채널별 모델 학습 및 앙상블 적용으로 유사도 검출 정확도 97.5% 달성.

Awards

  • DaCon 문맥 기반 문장 순서 예측 — 8위2025.05
  • Hecto 중고차 이미지 분류 — 상위 10%2025.06
  • DaCon 자갈·암석 분류 — 상위 8%2025.04

Certifications

  • Microsoft Azure AI-9002025.07
  • OPIc Intermediate Mid 12024.12
  • 1종보통운전면허2021.04

Military

  • 육군 병장 만기 전역2019.09 — 2021.04