spectral clustering에 대해서 정리해보겠습니다.
일반적인 clustering 클러스터링을 하기 위해서는 개체 간의 거리를 재는 것이 중요합니다. 이 때, 이 개체 간의 거리를 무엇으로 재는가? 가 중요한데, 데이터가 이라면, 는 개체의 이름, 은 개체가 가진 특성의 이름이 되겠죠. - 예를 들...
Python, Java, AI/ML, Vim, Web, CS 이론 등 소프트웨어 개발 및 엔지니어링 기록
일반적인 clustering 클러스터링을 하기 위해서는 개체 간의 거리를 재는 것이 중요합니다. 이 때, 이 개체 간의 거리를 무엇으로 재는가? 가 중요한데, 데이터가 이라면, 는 개체의 이름, 은 개체가 가진 특성의 이름이 되겠죠. - 예를 들...
클러스터링을 다시 공부합니다. unsupervised learning인 클러스터링은 쉽게 생각하면, 비슷한 놈들끼리 묶어 준다는 이야기가 됩니다. 우선, '비슷한'을 정의해야 하는데, 개별 instance가 numerical vector로 표현된...
tsne는 얼마나 느린가요. 보통 차원이 너무 큰 데이터를 다루다 보니, 차원축소를 해야 할 때가 많은데, 그때 를 써야하나, 를 써야 하나 고민하게 됩니다. pca가 훨씬 빠르기는 한데, 굴곡이 진 부분, 즉 구부러진 부분을 무시하게 된다는 단...
boxplot을 예쁘게 그립시다. 지금 값들에 outlier가 있는가 없는가를 확인하려면 boxplot을 그리는 게 좋습니당. 아웃라이어가 얼마나 많은지, 어느 정도에서 다른 값들을 모두 버리는게 좋은지 등등은 boxplot으로 확인하는게 좋다고...
subplot의 사이즈는 어떻게 조절할 수 있을까요? 전체 figure에서 한번에 조절할 수있는 방법이 있는건가 싶었는데(아마도 있긴 있겠지만), grid로 한번에 넘겨주는 게 더 깔끔한 것 같아요. 네 여기서는 gridspec이라는 것을 사용해...
document clustering 뭐, 지금까지 간단하게 자연어 전처리 해주는 것들(영어에 대해서만)과 워드임베딩 등을 했습니다. 대략 어떤 메소드들이 있는지에 대해서 아주 간단하게 발을 담궈 보았고, 이제는 이것들을 어떻게 활용할지에 대한 고...
text에 간단한 전처리를 하기 위해 textblob, nltk를 사용합시다. 사실 nlp에서 가장 중요한 것은 데이터 전처리입니다. 텍스트는 너무 중구난방이라서, 깔끔하게 정리해주는 게 굉장히 중요하고 또 필요합니다. 따라서 여기서는 비교적 단...
one-hot encoding to word embedding 요즘 아무래도 포스팅이 중복되는 느낌들이 있습니다. 제가 이 블로그를 공부하면서 그 과정을 계속 쓰기 때문에 이 포스트 또한 지난 번에 쓴 내용들과 겹치는 부분들이 있을 것 같습니다....
word-embedding을 하고 그 결과를 뿌려주는 과정에서, 학습을 많이 할수록, '의미적으로 유사한 단어들이 모인다'는 것을 보여주려고 하는데, 매번 똑같은 그림을 여러번 보여주는 것보다는 하나의 figure안에 으로 넣어주는 것이 훨씬 예...
matplolib로 그림 그릴 때, text 표시하기. 을 통해 만든 결과를 를 통해 2차원 공간에 표시하고 있는데, 이 때 각 위치에 text를 표시해주는 것이 좋아서 표시해주는 방법을 정리하기로 합니다. 말고도 도 있는데, 의 경우는 폰트의 ...
how to cluster 키워드 분석 중. 키워드를 활용해서 키워드 네트워크를 만들었고, 따라서 여기서 adjancency matrix or bi-adjancency matrix를 만들 수 있다. 여기까지는 됐고, 이 말은 다시 말하면, 개별 ...
후 키워드 네트워크부터 다시 합시다. 데이터 전처리부분은 거의 다 한 것 같아요. 맨 끝에 설명하겠습니다. 이제는 정말 단일한 데이터 집단을 모은게 아닐까 싶습니다. 키워드 네트워크를 구성했을 때, 만든 네트워크에서 잘못된 노드 들이 있는 경우가...
일반적으로 쓰는 networkx 의 function들은 centrality, draw, add/remove node and edges 가 다인데, 이 외에도 꽤나 유용한 함수들이 많이 있습니다. 이것들을 좀 정리해두는 것이 필요하다고 생각됨. n...
네트워크 상에서 비슷한 역할을 하는 노드를 찾아봅시다! structural equivalence, '구조적 등위성'으로 표현할 수 있을텐데, 네트워크 상에서의 연결성을 확인해보면, 두 노드가 '의미적으로 비슷하다'는 것을 의미하는 성질입니다. 대...
bipartite graph를 다뤄 봅시다. author keyword 와 index keywords 는 서로 다른 의미를 가집니다. 하나의 논문에는 author keyword와 index keyword가 둘 다 있는데, 이 edge를 중심으로 ...
작업일지 제가 궁극적으로 하려는 것은 '저자 키워드'를 필터링 하려는 것입니다. 'small and medium enterprise' 와 'sme'는 같은 의미를 가집니다. 그렇다면 이 두 가지가 모두 표현될 필요는 없겠죠. 따라서 이를 변환하고...