본문 바로가기

전체 글65

논문 번역 및 요약) Vision Transformers for Dense Prediction 논문 원문 링크 : Vision Transformers for Dense PredictionVision Transformers for Dense PredictionAbstract 밀집 예측(dense prediction) 작업을 위한 모델 백본을 컨볼루션 신경망 대신에 ViT(Vision Transformer)를 사용하는 dense vision transformer를 소개한다.참고) 여기서 "밀집 예측"이라는 용어로 소개한 dense prediction은 이미지 전체에 대한 하나 또는 소수의 대표값을 예측하는 대신에 더 세밀한 위치마다 값을 예측하는 작업이다.여기서 더 세밀한 위치는 픽셀(화소, pixel) 또는 세분화된 공간 위치를 의미하여, 이러한 위치에 대하여 깊이, 클래스, 움직임, 표면의 방.. 2026. 5. 15.
윈도우 환경에서 VSCode로 원격 서버 접속시(Remote-SSH), BadInstallScriptResult 문제 해결 서버환경에서 딥러닝 훈련 등 원격 작업을 하려고 할 때, 우리는 VSCode(비주얼 스튜디오 코드)의 Remote-SSH 익스텐션(확장 프로그램)을 사용하여 종종 작업을 진행한다.나 또한 직접 코드를 작성하여 쉘 상에서 직접 실행해야 하는 경우라면, 직접 SSH 접속하는 대신에 VSCode를 사용해 작업을 주로 수행해왔었다. 그런데 유독, 오래전부터 사용해왔던 윈도우(Windows) 노트북에서 원격 서버에 접속할 때는 BadInstallScriptResult 오류와 함께 접속이 거부되는 문제가 발생해 왔었다.VSCode의 Remote-SSH를 사용한 원격 접속이 거부되는 경우에 검색할 수 있었던 해결책들은원격 서버(리눅스 환경이라면)의 홈 디렉토리의 vscode 원격 접속 관련 디렉토리에 손상된 설치 파.. 2026. 3. 2.
논문 번역 및 요약) Multi-View Collaborative Learning Network for Speech Deepfake Detection 논문 원문 : Multi-View Collaborative Learning Newtork for Speech Deepfake DetectionAbstract 딥러닝 기술의 발전과 더불어 text-to-speech 또는 voice conversion network를 통한 딥페이크 발화 합성(Deepfake speech)도 점점 실제 음성과 구별하기 어려워지고 있다.딥페이크 음성 탐색에 관한 현재 연구들은 주로 원래의 음성 파형(raw waveform) 또는 스펙토그램(spectrogram) 중 하나로부터 특성을 추출하는 데 초점을 맞추고 있다.이 경우, 두 형태(모달리티,modality)간에 존재할 수 있는 중요한 상관관계가 간과될 수 있고, 이로부터 이전에 본 적 없는 딥페이크 음성의 탐색 성능이 향상될.. 2026. 2. 14.
논문 번역 및 요약)LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models 논문 원문 : LLaMA-Mesh : Unifying 3D Mesh Generation with Language Models프로젝트 페이지 : Nvidia Research : LLaMA-MeshAbstract이 논문은 대규모 언어모델(LLM)의 능력을 확장시켜서, 하나의 통합된 모델 안에서 텍스트 입력으로 3D 메시를 생성(text-to-3D Mesh)하는 방법을 탐구한다.이 연구는 다음과 같은 장점을 제공할 수 있다.(1) LLM 안에 임베딩된(=학습된) 공간적 지식(spatial knowledge)을 활용할 수 있게 된다.(2) 대화방식을 통한 3차원 (객체) 생성과 3차원 메시에 대한 이해를 가능하게 한다.이 작업에서 가장 어려웠던 점은 3차원 메시 데이터를 LLM이 처리할 수 있는 개별 토큰이 되.. 2024. 11. 28.