Coding (269)


식물 데이터도 분석이 되나요?

결론부터 말하자면 분석은 된다. 되는데 데이터 리소스를 NCBI로 하는 건 비추다. 왜냐고? 그 이유는 올리면서 말해드림..def plot_lht_family_tree(alignment_file): align = AlignIO.read(alignment_file, "fasta") calculator = DistanceCalculator('identity') constructor = DistanceTreeConstructor(calculator, 'nj') tree = constructor.build_tree(align) fig = plt.figure(figsize=(15, 8)) ax = fig.add_subplot(1, 1, 1) plt.title("Arab..

매우 주관적인 씨본 컬러맵 고르는 방법

https://seaborn.pydata.org/tutorial/color_palettes.html Choosing color palettes — seaborn 0.13.2 documentationChoosing color palettes Seaborn makes it easy to use colors that are well-suited to the characteristics of your data and your visualization goals. This chapter discusses both the general principles that should guide your choices and the tools in seaborn thseaborn.pydata.org여기 들어가보면 아주 온갖..

포켓몬과 이항분포

https://koreanraichu.tistory.com/760 포켓몬 이로치가 나올 확률로 이항분포를 때려보자일단 이항분포가 뭐냐… 특정 확률(p)을 가진 베르누이 시행을 n번 독립적으로 반복했을 때, 성공하는 횟수(X)에 대한 이산 확률 분포라고 한다. Pass or Fail 뭐 이런건데, 여기서 중요한 건 결과가koreanraichu.tistory.com이거 파이썬으로 하는거 맞음.성비와 이항분포포켓몬에는 성비가 존재한다. 성비가 불명(무성)이거나 한쪽으로 쏠려있는 경우도 있지만 보통은 암수가 다 있는데 비율이 다른 경우가 많다. 님들 솔직히 세꿀버리 비퀸 만들어야되는데 암컷 안떠서 피눈물 흘리신 적 있으시죠? 난 있음... 아오 포고 야도뇽이 자꾸 수컷만 나와서 대환장파티여... # p(성비):..

캐글 EDA-마! 서퍼티파이! (2)

캐글 EDA-마! 서퍼티파이! (2)

https://koreanraichu.tistory.com/839 캐글 EDA-마! 서퍼티파이!https://www.kaggle.com/datasets/serkantysz/550k-spotify-songs-audio-lyrics-and-genres/data 550K Spotify Songs: Audio, Lyrics & GenresEnhanced Music Dataset with Audio Features, Lyrics, Genres & Artist Metadatawww.kaggle.com참고로 본인은 스포티파koreanraichu.tistory.com우리 어제 전처리까지 하고 끝냈음… 기억하시죠? 하다하다 VScode가 뻗었다고…아티스트 분석여기는 뭐 없어서 분량도 짧다. # 1그룹에 다 몰렸구나.....

캐글 EDA-마! 서퍼티파이!

https://www.kaggle.com/datasets/serkantysz/550k-spotify-songs-audio-lyrics-and-genres/data 550K Spotify Songs: Audio, Lyrics & GenresEnhanced Music Dataset with Audio Features, Lyrics, Genres & Artist Metadatawww.kaggle.com참고로 본인은 스포티파이 계정이 있습니다. 왜냐고? 포슬립 사운드트랙이 거기 있으니까...import kagglehub# Download latest versionpath = kagglehub.dataset_download("serkantysz/550k-spotify-songs-audio-lyrics-and-ge..

그냥 해보는 ChEMBL EDA

이걸 근데 카테고리를 만들어야될지는 모르겠음… 이걸 매일 할 것 같지는 않고… 켐블서 특정 분자나 질환 치면 관련 화합물이 쭈루룩 나옵니다. 그거갖고 한거임.거 정보좀 봅시다df.shape()(63, 29)켐블 데이터 특: 칼럼 엄청 많음 df.info()RangeIndex: 63 entries, 0 to 62Data columns (total 29 columns): # Column Non-Null Count Dtype --- ------ -------------- ----- 0 ChEMBL ID 63 non-null object 1 Name 62 non-null object ..

캐글 EDA-Video game sales

캐글 EDA-Video game sales

https://www.kaggle.com/datasets/gregorut/videogamesales Video Game SalesAnalyze sales data from more than 16,500 games.www.kaggle.com본인은 겜덕후다. 자타공인 겜덕후이고 모바일 피씨 콘솔 할 것 없이 어지간한 게임은 다 했으며 가끔 무지하게 주관적인 리뷰를 올리기도 하고 집에는 각종 노랑뚱띵이와 굿즈들이 가득한. 그런데 비디오 게임 판매량 데이터??? 야이씨 이건 겜덕후로써 못참지! 해서 제미나이를 부려먹었다.모듈import numpy as npimport pandas as pdimport matplotlib.pyplot as pltimport seaborn as sns# 그래프 기본 테마 설정sns..

데이터프레임의 정보를 확인하는 몇 가지 방법

여러분은 데이터를 분석할 때 제일 먼저 해야 하는 게 뭔지 아십니까? 물론 데이터를 얻는걸 제일 먼저 해야겠지만, 데이터를 다 얻고 나면 데이터를 체크하고 전처리로 뭘 할 지를 정해야 한다. 근데 지금 리눅스 업글중이라 둘 다 다룰 수 있을지는 모르겠음.df.info()데이터프레임의 정보를 확인할 수 있다. RangeIndex: 299 entries, 0 to 298Data columns (total 13 columns): # Column Non-Null Count Dtype --- ------ -------------- ----- 0 age 299 non-null float..

폐암 데이터를 분석해서 생존률을 비교해보자

일단 결론부터 말하겠음. 아직 중순 안됐으면 연초나 마찬가지니까 지금 당장에라도 담배 끊으십쇼.# 모듈import numpy as npimport pandas as pdimport matplotlib.pyplot as pltimport seaborn as snsfrom lifelines import KaplanMeierFitter # 이친구가 생존곡선을 잘 그려요 아무튼 그럼 import GEOparse # NCBI GEO에 접근할 때 필요함 from Bio import Entrez # NCBI 창고털이 드가자 # 그래프를 그리기 위한 기본 설정plt.rcParams['font.family'] = 'Nanumbarunpen'# plt.rcParams['font.family'] = 'AppleGothic'..

베이즈 정리

베이즈 정리

베이즈 정리는 두 확률 변수의 사전 확률과 사후 확률사이의 관계를 나타내는 정리이다. 뭔 개소리임? ㅈㅅ 나도 이해를 못했음. 사전 확률(기존 믿음)과 새로운 정보(증거)를 결합하여 사후 확률(갱신된 믿음)을 계산하는 확률론적 방법이라고 하는데 이것도 확 와닿는 얘기는 아니었습니다. 이거 공식은 되게 심플... 할수도 있고 아닐수도 있음.공식이 이게 다인데 보통 P(B)는 안준다. 그래서 저걸 또 전확률의 정리? 그걸 써서 구해야된다. 근데 저 바는 뭔데요? 조건부확률(P(A|B) = 어떤 사건(B)이 이미 일어났다는 전제 하에, 다른 사건(A)이 일어날 확률)이다. 그 생선님이 유튜브에 올린거 보면 비유를 개찰떡으로 해놨는데 봅시다. 어떤 게임의 가챠 확률표에서 SSR 확률이 0.001%이고 SSR ..

인플루엔자의 해마글루티닌 게놈을 받아서 MSA를 해보자

좋은 소식. 이거는 전편 후편 없다. 나쁜 소식. 트리가 한타떄에 비해 안이쁘다.# 모듈import numpy as npimport matplotlib.pyplot as pltimport matplotlib.cm as cm # 넌 뭐냐 from Bio import Entrez, SeqIO # 왼쪽: 일단 털어보자/오른쪽: 시퀀스 다루려면 필요합니다. 필수임. from Bio import AlignIO # 서열 분석해줄 친구from Bio import Phylo # 트리 그릴라면 필요해요 from Bio.Phylo.TreeConstruction import DistanceCalculator, DistanceTreeConstructorimport io # 누구세요?import subprocess # 서브 프..

한타바이러스의 시퀀스를 받아서 MSA를 해보자 (후편)

한타바이러스의 시퀀스를 받아서 MSA를 해보자 (후편)

https://koreanraichu.tistory.com/824 한타바이러스의 시퀀스를 받아서 MSA를 해보자 (전편)https://koreanraichu.tistory.com/79 Biopython으로 MSA 해보기MSA: multiple sequence alignment 여기에 관한 이론적인 설명은 나중에 또 입 털어드림 ㅇㅇ 아 참고로 MSA 관련해서 다른건 다 결과가 제대로 나왔는데koreanraichu.tistory.com우리 여기서 MSA 돌릴 FASTA파일 저장했죠? 후편에서는 그걸로 분석을 돌릴건데… 아… 이거 트리땜에 개노가다했음… 그것도 트리 얘기하면서 얘기해드리겠음.# 바이러스 DNA가 세그먼트별로 섞여있습니다. (S, M, L)# 이거 분류 안하면 MSA 뻑나요. s_segment..