Skip to content

Noun extractor covered eojeols 관련 질문 #94

Description

@jeongwookie

안녕하세요 Noun extractor을 잘 사용하고 있는 학생입니다!
다름 아니라 사용 중에 의문이 하나 들어서 질문 드리게 되었습니다.
input으로 사용하는 doublespace txt 파일의 sentence length가 얼마가 되어야 많은 범위의 어절을 커버하게 되나요?
제가 몇가지 샘플을 만들어서 사용해 보았는데, 인풋 데이터가 적으면 적을수록 명사를 잘 못 뽑는 것 같습니다. (비지도학습 기반의 모델이라 당연하지만요 ㅎㅎ)

예를 들어서, num sentence가 약 1만개일 경우 50~55%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 54.52 % eojeols are covered

num sentence가 약 10만개일 경우 60~65%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 62.31 % eojeols are covered

num sentence가 100개 단위로 적은 경우, 약 10~20%의 어절이 커버되었다고 출력됩니다.
[Noun Extractor] 19.58 % eojeols are covered

아예 극단적으로 적은 경우 (num sentence = 100개 호혹은 그 이하), 5~10% 정도밖에 커버되지 않습니다.
[Noun Extractor] 6.21 % eojeols are covered
[Noun Extractor] 2.26 % eojeols are covered

어느 정도의 데이터를 가지고 input 파일을 만들어야 최대한 로스를 줄일 수 있을까요?
좋은 모델 만들어주셔서 감사합니다.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions