바로가기메뉴

본문 바로가기 주메뉴 바로가기

logo

검색어: 데이터 학술지, 검색결과: 3
1
김판준(경제․인문사회연구회) ; 이재윤(경기대학교) 2010, Vol.27, No.1, pp.269-287 https://doi.org/10.3743/KOSIM.2010.27.1.269
초록보기
초록

최근까지 학술지의 영향력을 측정하기 위하여 Thomson Reuters(ISI)의 영향력지수(JIF: Journal Impact Factor)가 널리 사용되어왔다. 그러나, 이러한 JIF는 학술지 단위가 아니라 수록 논문의 평균 영향력을 측정하는 지표라는 근본적인 한계를 가지고 있으며, 이외에도 다양한 측면에서 많은 문제점들이 지적되었다. 특히 국내 인용색인은 국제적인 인용색인 데이터베이스에 비해서 인용 데이터의 규모가 상당히 제한적이므로, 이를 고려하여 국내 학술지 인용 환경에 적합한 지수의 적용이 필요하다. 따라서 이 연구는 최근 급속히 확산되고 있는 Hirsch 유형 지수(h-type indices)를 적용하여 국내 학술지의 영향력을 보다 더 상세하게 측정할 수 있는 실제적인 방안을 모색하였다. 결과적으로, h-지수의 변형지수(hs-지수, fs-지수)를 사용하거나 호 단위 합산(호 기반 h-지수, 호 기반 f-지수) 방법을 통하여, 기존 Hirsch 유형 지수들의 변별력을 향상시킬 수 있음은 물론 국내 학술지의 영향력을 더욱 정밀하게 측정할 수 있는 것으로 나타났다.

Abstract

The journal impact factor(JIF) of the Thomson Reuters(ISI) has been widely used to assess the impact of journal as well as its quality. However, the JIF contains its critical limitation, in which it does not measure the impact of journal but the average impact of articles in journal. Besides significant number of problems of the JIF has been noticed. Furthermore, given the limited coverage of domestic citation index database in comparison to those of international citation index, it is necessary to apply a more appropriate index with a high level of discriminating power. This study, therefore, aims to introduce some practical methods to measure the impact of domestic journals by using the Hirsch-type indices. As the Hirsch-type indices has been often used for overcoming the limitations of the JIF in worldwide, we hope that our research outcome offers an effective alternative to gauge the impact of journals more accurately. Consequently, using the variations of the h-index(hs-index, fs-index) or the sum of issue level(issue based h-index, issue based f-index), we argue that it would improve the discrimination capacity of the Hirsch-type indices significantly and that we can measure the impact of domestic journals more clearly.

초록보기
초록

국내 학술연구의 동향을 구체적으로 파악하여 연구개발 활동의 체계적인 지원 및 평가는 물론 현재와 미래의 연구 방향을 설정할 수 있는 기초 데이터로서, 개별 학술지 논문에 표준화된 주제 범주(통제키워드)를 부여할 수 있는 효율적인 방안을 모색하였다. 이를 위해 한국연구재단 「학술연구분야분류표」 상의 분류 범주를 국내 학술지 논문에 자동 할당하는 과정에서, 자질선정 기법을 중심으로 자동분류의 성능에 영향을 미치는 주요 요소들에 대한 다각적인 실험을 수행하였다. 그 결과, 실제 환경의 불균형 데이터세트(imbalanced dataset)인 국내 학술지 논문의 자동분류에서는 보다 단순한 분류기와 자질선정 기법, 그리고 비교적 소규모의 학습집합을 사용하여 상당히 좋은 수준의 성능을 기대할 수 있는 것으로 나타났다.

Abstract

As basic data that can systematically support and evaluate R&D activities as well as set current and future research directions by grasping specific trends in domestic academic research, I sought efficient ways to assign standardized subject categories (control keywords) to individual journal papers. To this end, I conducted various experiments on major factors affecting the performance of automatic classification, focusing on feature selection techniques, for the purpose of automatically allocating the classification categories on the National Research Foundation of Korea’s Academic Research Classification Scheme to domestic journal papers. As a result, the automatic classification of domestic journal papers, which are imbalanced datasets of the real environment, showed that a fairly good level of performance can be expected using more simple classifiers, feature selection techniques, and relatively small training sets.

초록보기
초록

대표적인 앙상블 기법으로서 랜덤포레스트(RF)를 문헌정보학 분야의 학술지 논문에 대한 자동분류에 적용하였다. 특히, 국내 학술지 논문에 주제 범주를 자동 할당하는 분류 성능 측면에서 트리 수, 자질선정, 학습집합 크기 등 주요 요소들에 대한 다각적인 실험을 수행하였다. 이를 통해, 실제 환경의 불균형 데이터세트(imbalanced dataset)에 대하여 랜덤포레스트(RF)의 성능을 최적화할 수 있는 방안을 모색하였다. 결과적으로 국내 학술지 논문의 자동분류에서 랜덤포레스트(RF)는 트리 수 구간 100〜1000(C)과 카이제곱통계량(CHI)으로 선정한 소규모의 자질집합(10%), 대부분의 학습집합(9〜10년)을 사용하는 경우에 가장 좋은 분류 성능을 기대할 수 있는 것으로 나타났다.

Abstract

Random Forest (RF), a representative ensemble technique, was applied to automatic classification of journal articles in the field of library and information science. Especially, I performed various experiments on the main factors such as tree number, feature selection, and learning set size in terms of classification performance that automatically assigns class labels to domestic journals. Through this, I explored ways to optimize the performance of random forests (RF) for imbalanced datasets in real environments. Consequently, for the automatic classification of domestic journal articles, Random Forest (RF) can be expected to have the best classification performance when using tree number interval 100〜1000(C), small feature set (10%) based on chi-square statistic (CHI), and most learning sets (9-10 years).

정보관리학회지