안녕하세요 Noun extractor을 잘 사용하고 있는 학생입니다!
다름 아니라 사용 중에 의문이 하나 들어서 질문 드리게 되었습니다.
input으로 사용하는 doublespace txt 파일의 sentence length가 얼마가 되어야 많은 범위의 어절을 커버하게 되나요?
제가 몇가지 샘플을 만들어서 사용해 보았는데, 인풋 데이터가 적으면 적을수록 명사를 잘 못 뽑는 것 같습니다. (비지도학습 기반의 모델이라 당연하지만요 ㅎㅎ)
예를 들어서, num sentence가 약 1만개일 경우 50~55%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 54.52 % eojeols are covered
num sentence가 약 10만개일 경우 60~65%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 62.31 % eojeols are covered
num sentence가 100개 단위로 적은 경우, 약 10~20%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 19.58 % eojeols are covered
아예 극단적으로 적은 경우 (num sentence = 100개 호혹은 그 이하), 5~10% 정도밖에 커버되지 않습니다.
[Noun Extractor] 6.21 % eojeols are covered
[Noun Extractor] 2.26 % eojeols are covered
어느 정도의 데이터를 가지고 input 파일을 만들어야 최대한 로스를 줄일 수 있을까요?
좋은 모델 만들어주셔서 감사합니다.
안녕하세요 Noun extractor을 잘 사용하고 있는 학생입니다!
다름 아니라 사용 중에 의문이 하나 들어서 질문 드리게 되었습니다.
input으로 사용하는 doublespace txt 파일의 sentence length가 얼마가 되어야 많은 범위의 어절을 커버하게 되나요?
제가 몇가지 샘플을 만들어서 사용해 보았는데, 인풋 데이터가 적으면 적을수록 명사를 잘 못 뽑는 것 같습니다. (비지도학습 기반의 모델이라 당연하지만요 ㅎㅎ)
예를 들어서, num sentence가 약 1만개일 경우 50~55%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 54.52 % eojeols are covered
num sentence가 약 10만개일 경우 60~65%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 62.31 % eojeols are covered
num sentence가 100개 단위로 적은 경우, 약 10~20%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 19.58 % eojeols are covered
아예 극단적으로 적은 경우 (num sentence = 100개 호혹은 그 이하), 5~10% 정도밖에 커버되지 않습니다.
[Noun Extractor] 6.21 % eojeols are covered
[Noun Extractor] 2.26 % eojeols are covered
어느 정도의 데이터를 가지고 input 파일을 만들어야 최대한 로스를 줄일 수 있을까요?
좋은 모델 만들어주셔서 감사합니다.