NLTK | Data Science

NLTK: N-gramy

utworzone przez Przemek | sty 26, 2021 | NLP

nltk-n-gramy N-gramy to sekwencje następujących po sobie elementów. N = ilość elementów występujacych w sekwencji: 1-gram — unigram, 2-gram — bigram, 3-gram — trigram, 4-gram, 5-gram, itd. In [1]: tokens = "W tym zdaniu jest kilka wyrazów o różnej długości".split(" ")...

NLTK: tokenizacja i steaming

utworzone przez Przemek | sty 3, 2021 | NLP

nltk-tokenizacja_i_steaming 3 najbardziej popularne tokenizatory z biblioteki NLTK SpaceTokenizer¶ w odróżnieniu od spaCy dzieli wyłącznie po spacji In [1]: from nltk.tokenize import SpaceTokenizer space_tokenizer = SpaceTokenizer() text = "Budynek powstawał w latach...

SpaCy po polsku – Bag Of Words

utworzone przez Przemek | gru 27, 2020 | NLP

spaCy_po_polsku-bag-of-words Bag-of-words (BoW) – technika uproszczonej reprezentacji tekstu. Polega na przekształeceniu sekwencji segmentów do policzonego zbioru segmentów. Kolejność segmentów nie ma znaczenia. Głównym zastosowaniem jest odwzorowanie...

NLTK: Bag Of Words

utworzone przez Przemek | gru 27, 2020 | NLP

nltk-bag-of-words Bag-of-words (BoW) – technika uproszczonej reprezentacji tekstu. Polega na przekształeceniu sekwencji segmentów do policzonego zbioru segmentów. Kolejność segmentów nie ma znaczenia. Głównym zastosowaniem jest odwzorowanie podobieństwa...

P	W	Ś	C	P	S	N
« sty
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

NLTK: N-gramy

NLTK: tokenizacja i steaming

SpaCy po polsku – Bag Of Words

NLTK: Bag Of Words

Ostatnie wpisy

Tagi