You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Log in or Sign Up to review the conditions and access this model content.

SentenceTransformer based on dndjd03/klue-roberta-base-klue-sts

This is a sentence-transformers model finetuned from dndjd03/klue-roberta-base-klue-sts. It maps sentences & paragraphs to a 768-dimensional dense vector space and can be used for retrieval.

Model Details

Model Description

  • Model Type: Sentence Transformer
  • Base model: dndjd03/klue-roberta-base-klue-sts
  • Maximum Sequence Length: 512 tokens
  • Output Dimensionality: 768 dimensions
  • Similarity Function: Cosine Similarity
  • Supported Modality: Text

Model Sources

Full Model Architecture

SentenceTransformer(
  (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'RobertaModel'})
  (1): Pooling({'embedding_dimension': 768, 'pooling_mode': 'mean', 'include_prompt': True})
)

Usage

Direct Usage (Sentence Transformers)

First install the Sentence Transformers library:

pip install -U sentence-transformers

Then you can load this model and run inference.

from sentence_transformers import SentenceTransformer

# Download from the 🤗 Hub
model = SentenceTransformer("sentence_transformers_model_id")
# Run inference
sentences = [
    '지난해 노르웨이정부연기금에 들어온 돈은 얼마인가?',
    '‘오일머니’를 등에 업고 글로벌 금융시장에서 위세를 떨치던 중동 국부펀드들의 힘이 빠지고 있다. 최근 1년 새 유가가 반토막 나면서 국부펀드의 주요 자금줄인 원유 판매대금이 크게 줄었기 때문이다. 돈줄이 마르기 시작한 산유국은 국부펀드에 대한 관리·감독도 강화하고 있다. 저유가와 강화된 규제로 주식, 채권, 대체투자시장에서 국부펀드의 투자 활동이 위축되면 글로벌 금융시장에 타격을 줄 수 있다는 분석도 나온다.재정 악화 산유국은 자금 인출20일(현지시간) 세계국부펀드연구소에 따르면 작년 세계 30여개 국부펀드의 부동산 매입 등 직접 투자 규모는 1124억달러(약 122조9990억원)로 집계됐다. 전년 대비 40% 감소했다. 2013년에는 전년 대비 181% 증가했다.전문가들은 최근 국제유가 흐름과 무관하지 않다고 분석했다. 이날 뉴욕상업거래소에서 서부텍사스원유(WTI) 가격은 배럴당 58.98달러였다. 이달 들어 반등 조짐을 보이고 있지만 공급 과잉 우려로 작년 고점 대비로는 45% 떨어졌다. 산유국이 평균 재정 손익분기점으로 여기는 75달러도 크게 밑돈다. 세계 국부펀드 자산은 작년 말 기준 7조570억달러로, 이 중 절반 이상이 원유 판매 수입에 의존하고 있다.조지 아베드 국제금융협회 아프리카·중동 책임자는 “유가 하락으로 산유국으로의 자금 유입이 줄고 있다”며 “산유국의 경제사정이 악화돼 정부가 국부펀드에서 일부 자금을 인출하는 사례도 나타난다”고 말했다.BNP파리바는 유가가 지금보다 높은 배럴당 70달러 수준(원유 생산량에 변동이 없을 경우)으로 연말까지 유지돼도 산유국의 원유 판매 수입이 올해 3160억달러 줄어들 것이라고 추산했다. 세계 최대 국부펀드인 노르웨이정부연기금에 올해 유입되는 자금 규모는 250억크로네(약 3조6115억원)로, 작년 1470억크로네에서 급감할 것으로 예상됐다.데이비드 스피겔 BNP파리바 전략가는 “국부펀드의 수입 감소는 앞으로 몇 년간 금융자산 수요를 둔화시킬 수 있다”며 “산유국이 투자를 통해 글로벌 금융시장 규모를 키우기보다 유동성 흡수에 나서는 것은 20년 만에 처음”이라고 말했다.운용 규제 강화로 투자 위축 가능성저유가가 지속된 1990년대 이후 가장 큰 재정난에 직면한 산유국은 국부펀드의 자산 운용과 수익률에 대한 감독과 규제를 대폭 강화하고 있다. 통상 국부펀드는 자산운용 수단과 수익률 정보를 투명하게 공개하지 않는다. 유가가 빠르게 상승할 때조차 별다른 정부의 간섭을 받지 않았다.국부펀드를 최초로 만든 쿠웨이트는 두 달 전 국부펀드조사위원회를 구성하고 자산 운용의 부당 행위와 부적절한 투자 행위를 조사 중이다. 쿠웨이트 국부펀드의 운용 자산은 5480억달러다. 국부펀드조사위원회는 국부펀드가 적정한 가격에 부동산을 매입했는지, 특정 자산에 대한 투자 결정이 적절했는지 등을 따진다.바레인 역시 국부펀드조사위원회를 꾸리고 110억달러를 운용하는 국부펀드 조사에 들어갔다. 다른 산유국의 상황도 크게 다르지 않다. 로이터통신은 “저유가로 정부가 국부펀드의 운용 활동에 더 예민해졌다”며 “복지 혜택 축소를 우려하는 국민의 우려를 잠재우려는 목적도 있다”고 해석했다.전문가들은 산유국의 이런 움직임이 국부펀드의 자유로운 투자 활동을 제약하고 투자 결정을 보수적으로 만들 수 있다고 말했다. 국부펀드는 과거 선진국 국채 등 안전자산에만 투자했지만 몇 년 전부터 수익률을 높이기 위해 부동산, 파생상품, 사모펀드, 헤지펀드, 인수합병(M&A) 시장으로까지 투자 영역을 넓히고 있다.',
    '11번가(사장 이상호)가 최근(12월 1~16일) ‘선물하기’ 서비스의 거래현황을 분석한 결과 ‘크리스마스 케이크 e쿠폰’에 이어 ‘마스크’의 판매 수량이 많았다. 생활 필수품으로 자리잡은 마스크를 크리스마스와 연말 선물로 전달하는 이들이 크게 늘어난 것으로 보인다. 이어 집콕 생활에 필요한 ‘커피/생수 등 음료’와 ‘간편식’의 인기가 높았다. 11번가의 ‘선물하기’는 상대방의 주소를 몰라도 휴대폰 문자메시지나 카카오톡으로 선물을 전달할 수 있는 서비스로, 11번가에서 판매되고 있는 1억개 이상의 제품들이 대상이다. 안전하고 편리하게 선물을 전달할 수 있는 장점 때문에 지난 11일 월간십일절에 ‘선물하기’ 서비스 거래액은 지난 9월 서비스를 오픈한 첫 주 최고 일거래액 대비 15배 이상 급증하며 인기를 끌고 있다. 11번가는 ‘선물의 달’인 12월을 맞아 ‘선물하기 전문관’에서 크리스마스와 연말연시 선물 기획전을 다양하게 진행한다. ‘10% 할인쿠폰’(최대 5,000원)을 선착순으로 제공하고 OK캐쉬백을 최대 3000포인트 적립해줘 보다 알뜰한 혜택을 누릴 수 있도록 했다. 오는 20일까지 열리는 ‘랜선타고 산타선물’ 기획전에서는 크리스마스 분위기가 물씬한 선물용 상품들을 다양하게 선보인다. 간편하게 연말 분위기를 즐길 수 있는 ‘크리스마스 벽트리 세트’, ‘모닥불 무드등’ 등 인테리어 소품, 인기 외식메뉴가 담긴 밀키트 등을 판매한다. 새해를 앞두고 100여 종의 제품을 할인 판매하는 ‘다이어리 선물 기획전’도 오는 31일까지 진행한다. 톡톡 튀는 MZ세대를 겨냥한 ‘쓸데없는 선물하기’ 기획전도 마련했다. 친한 지인들끼리 활용도가 낮은 선물을 재미로 교환하는 트렌드를 반영해 가짜 팔 깁스, 모형 핸드폰, 앞뒤 디자인이 똑같은 ‘양면 셔츠’ 등 이색 상품들을 판매한다. 11번가 김기욱 선물하기팀장은 “비대면 시대 연말 선물 수요가 온라인으로 이동하면서 11번가를 찾는 고객들이 원하는 선물을 간편하게 구매해 안전하게 전달할 수 있도록 다양한 상품들과 혜택을 준비해 12월 내내 선보인다”고 말했다. 현재 ‘11번가 선물하기’ 전문관에서는 고객들이 선물을 고르는 데 도움을 주는 큐레이션 코너를 다양하게 선보이고 있다. 성별, 연령, 가격대에 따라 인기 선물을 추천하는 ‘11번가 추천선물’, 최신 트렌드에 적합한 선물을 소개하는 ‘요즘 HOT한 선물’ 등 활용도가 높은 콘텐츠를 제공하고 있다.',
]
embeddings = model.encode(sentences)
print(embeddings.shape)
# [3, 768]

# Get the similarity scores for the embeddings
similarities = model.similarity(embeddings, embeddings)
print(similarities)
# tensor([[ 1.0000,  0.5308, -0.0373],
#         [ 0.5308,  1.0000,  0.0207],
#         [-0.0373,  0.0207,  1.0000]])

Evaluation

Metrics

Semantic Similarity

Metric Value
pearson_cosine 0.8106
spearman_cosine 0.8203

Training Details

Training Dataset

Unnamed Dataset

  • Size: 17,552 training samples
  • Columns: sentence_0 and sentence_1
  • Approximate statistics based on the first 100 samples:
    sentence_0 sentence_1
    type string string
    modality text text
    details
    • min: 11 tokens
    • mean: 17.57 tokens
    • max: 30 tokens
    • min: 267 tokens
    • mean: 433.21 tokens
    • max: 512 tokens
  • Samples:
    sentence_0 sentence_1
    대내림'을 행한 뒤 다음 순서는? 경기도에서 연행되는 굿의 한 가지로 일명 대동굿·치성굿이라고 하는데 매년 음력 10월 상달 추수 후 마을이 무사하고 잘 되기를 도당대감(都堂大監) 삼불제석(三佛帝釋)에게 비는 굿이 도당굿이다. 경기도 지역에서 마을의 으뜸신[都神]을 모신 당인 도당(都堂)에서 지내는 마을굿. 별칭으로는 ‘고창굿’이라 부르는 지역도 있다. 옛 시흥군 소래면 포리(浦里, 현 인천시 남동구)를 비롯해 장봉섬, 사섬, 떼무리섬 등 다수의 지역에서 정월에 행해졌으나, 음력 3월 3일과 10월 10일에 도당굿이 치러지는 사례도 흔히 찾아볼 수 있어 일정하지 않다.

    인천·부천 등 경기도 남부지방에서 세습무가 주관하는 도당굿 절차 및 진행과정을 보면, 굿은 마을의 신당이나 신목(神木)이 있는 근처에 차일을 치고 굿당을 꾸며 행하게 되는데, 맨 먼저 무당은 부정굿으로 굿당을 깨끗이 정화한다. 부정굿이 끝나면 마을의 당(堂)으로 도당신을 모시러 가는 ‘도당모시기’를 한다. 이처럼 마을의 안녕을 위해서 굿판을 벌여 치성과 제사를 지내는 것을 도당굿, 대동굿, 별신굿으로 불리고 있다.

    마을의 주민 가운데 한 사람에게 대를 내려 도당신이 강림한 것을 확인하는 ‘대내림’이 행하여진다. 전생과 현세의 삶과 수행을 귀하게 여기듯 티베트 불교(라마교)에서 전생과 현세의 불국(佛國, 관음의 정토)과 나라를 동일시하며 달라이라마를 관음의 '대내림' 화신이라고 생각하는 것과 비슷하다. 이어서 굿패는 ‘돌돌이’를 하는데 이것은 무당패들이 마을의 우물·장승·집 등을 무악을 울리면서 한바퀴 도는 것으로, 도당신의 영력으로 잡귀를 몰아내고 마을 전체를 정화시킨다는 의미를 가진다.

    굿당에 돌아와서는 당금애기신화가 구송되고 바라춤을 추는 ‘제석굿’을 하고, ‘본향굿’에서 도당할머니·도당할아버지를 모신 뒤 손굿(또는 손님굿)에서 천연두신인 손님을 청하여 마을에 질병이 돌지 않기를 기원한다.

    다음에 잡귀를 쫓아내는 군웅굿을 한 뒤, 굿을 시작할 때 굿당으로 모셔왔던 도당신을 다시 마을의 당으로 돌려보내는 ‘도당모셔다드...
    재원 대책 없는 선심성 공약을 막기 위한 법안이 발의된 연도는? 6·4 지방선거를 앞두고 재원 대책 없는 선심성 공약이 쏟아지고 있다. ‘무상버스’ ‘100원 택시’ 같은 무상 시리즈 공약부터 광역급행철도(GTX)처럼 수조원이 들어가는 공약도 등장했다. 하나같이 이렇다 할 재원 대책은 없다. 국회는 이런 것을 막기 위해 2012년 의원입법으로 ‘페이고’ 법안을 발의했다. 하지만 1년6개월이 지나도록 논의조차 이뤄지지 않고 있다. 페이고(pay-go)는 ‘pay as you go(번 만큼 쓴다)’의 줄인 말로, 중앙이나 지방 정부가 새로운 재정 지출 사업을 추진할 때 이에 상응하는 세입 증가나 지출 축소 등 재원 조달 방안을 동시에 마련하도록 의무화하는 것이다. 국회가 페이고 도입에 미온적인 데는 이유가 있다. 현재 계류돼 있는 관련 법안은 페이고 원칙을 정부는 물론 의원입법에도 적용하자는 것이다. 의원들이 지역구의 표를 얻기 위해 ‘포퓰리즘(대중 인기 영합주의)’ 법안을 양산해 국가의 재정건전성을 해치는 것을 막자는 취지다. 하지만 야당은 물론 여당 일각에서도 페이고가 도입되면 자신들의 권한이 축소될 것이란 이유로 반대하는 기류가 강하다. 페이고 원칙 없이 예산이 낭비되면 피해는 국민에게 돌아온다. 서울시는 2010년 지방선거 당시 공약으로 내건 ‘3무정책’(무상보육·무상급식·무상의료)에 따라 보편적인 복지를 시행하다 보니 예산이 부족해 올봄부터 저소득층이 이용하는 초등학생 돌봄교실 혜택을 줄였다. 표를 얻기 위해 재원 대책 없이 내놓은 공약 때문에 정작 필요한 곳에 지원해야 할 예산이 ‘펑크’난 것이다. 민경국 강원대 경제학과 교수는 “지자체의 복지 사업도 중앙정부의 매칭 지원이 없으면 시행할 수 없는 만큼 국회에서 재정준칙에 따라 정부 사업을 감시했다면 무상복지 같은 무리한 공약은 애초 태어날 수 없었을 것”이라고 말했다. 안충영 전 규제개혁위원장(중앙대 석좌교수)은 “정치적 목적의 입법을 막도록 국회 스스로 규제하는 장치가 시급하다”고 강조했다.
    주전산기 교체에 직접 개입하여 문책경고를 받은 사람의 이름은? 금융감독원이 임영록 KB금융지주 회장과 이건호 국민은행장에게 ‘중징계’인 문책경고를 결정한 이유는 ‘직무상 감독의무를 게을리하고 심각한 내부통제 위반으로 금융기관의 건전한 운영을 가로막았다’고 판단했기 때문이다. 금감원의 금융기관 검사 및 제재에 관한 규정(18조 3항)은 ‘금융기관의 건전한 운영을 저해하는 행위를 한 경우’ 문책경고를 내릴 수 있다고 명시하고 있다.금감원에 따르면 임 회장은 국민은행 전산시스템 교체사업과 그에 따른 리스크에 대해 수차례 보고를 받았는데도 감독의무를 제대로 이행하지 못했고 국민은행의 주전산기를 유닉스로 바꾸기 위해 자회사 인사(국민은행 IT본부장)에 부당하게 개입했다.이 행장의 경우 지난해 7월 취임 이후 감독자의 위치에서 주전산기 교체와 관련, 11차례에 걸쳐 보고를 받았는데도 위법·부당행위를 제대로 확인하지 못해 사태가 커지는 것을 방치했다. 국민은행 임직원은 주전산기를 교체하는 과정에서 컨설팅 보고서 및 성능과 소용비용 등을 이사회에 허위·왜곡 보고한 것으로 밝혀졌다. 임 회장과 이 행장이 이런 잘못으로 KB금융지주와 국민은행의 건전한 경영을 해쳤다는 게 금감원의 설명이다. 금감원 관계자는 “KB금융에 내분이 발생했을 때 자체 수습 노력이 미흡했다는 점도 중징계의 배경이 됐다”고 말했다.
  • Loss: MultipleNegativesRankingLoss with these parameters:
    {
        "scale": 20.0,
        "similarity_fct": "cos_sim",
        "gather_across_devices": false,
        "directions": [
            "query_to_doc"
        ],
        "partition_mode": "joint",
        "hardness_mode": null,
        "hardness_strength": 0.0
    }
    

Training Hyperparameters

Non-Default Hyperparameters

  • per_device_train_batch_size: 16
  • num_train_epochs: 1
  • per_device_eval_batch_size: 16
  • batch_sampler: no_duplicates
  • multi_dataset_batch_sampler: round_robin

All Hyperparameters

Click to expand
  • per_device_train_batch_size: 16
  • num_train_epochs: 1
  • max_steps: -1
  • learning_rate: 5e-05
  • lr_scheduler_type: linear
  • lr_scheduler_kwargs: None
  • warmup_steps: 0
  • optim: adamw_torch_fused
  • optim_args: None
  • weight_decay: 0.0
  • adam_beta1: 0.9
  • adam_beta2: 0.999
  • adam_epsilon: 1e-08
  • optim_target_modules: None
  • gradient_accumulation_steps: 1
  • average_tokens_across_devices: True
  • max_grad_norm: 1
  • label_smoothing_factor: 0.0
  • bf16: False
  • fp16: False
  • bf16_full_eval: False
  • fp16_full_eval: False
  • tf32: None
  • gradient_checkpointing: False
  • gradient_checkpointing_kwargs: None
  • torch_compile: False
  • torch_compile_backend: None
  • torch_compile_mode: None
  • use_liger_kernel: False
  • liger_kernel_config: None
  • use_cache: False
  • neftune_noise_alpha: None
  • torch_empty_cache_steps: None
  • auto_find_batch_size: False
  • log_on_each_node: True
  • logging_nan_inf_filter: True
  • include_num_input_tokens_seen: no
  • log_level: passive
  • log_level_replica: warning
  • disable_tqdm: False
  • project: huggingface
  • trackio_space_id: None
  • trackio_bucket_id: None
  • trackio_static_space_id: None
  • per_device_eval_batch_size: 16
  • prediction_loss_only: True
  • eval_on_start: False
  • eval_do_concat_batches: True
  • eval_use_gather_object: False
  • eval_accumulation_steps: None
  • include_for_metrics: []
  • batch_eval_metrics: False
  • save_only_model: False
  • save_on_each_node: False
  • enable_jit_checkpoint: False
  • push_to_hub: False
  • hub_private_repo: None
  • hub_model_id: None
  • hub_strategy: every_save
  • hub_always_push: False
  • hub_revision: None
  • load_best_model_at_end: False
  • ignore_data_skip: False
  • restore_callback_states_from_checkpoint: False
  • full_determinism: False
  • seed: 42
  • data_seed: None
  • use_cpu: False
  • accelerator_config: {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}
  • parallelism_config: None
  • dataloader_drop_last: False
  • dataloader_num_workers: 0
  • dataloader_pin_memory: True
  • dataloader_persistent_workers: False
  • dataloader_prefetch_factor: None
  • remove_unused_columns: True
  • label_names: None
  • train_sampling_strategy: random
  • length_column_name: length
  • ddp_find_unused_parameters: None
  • ddp_bucket_cap_mb: None
  • ddp_broadcast_buffers: False
  • ddp_static_graph: None
  • ddp_backend: None
  • ddp_timeout: 1800
  • fsdp: []
  • fsdp_config: {'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}
  • deepspeed: None
  • debug: []
  • skip_memory_metrics: True
  • do_predict: False
  • resume_from_checkpoint: None
  • warmup_ratio: None
  • local_rank: -1
  • prompts: None
  • batch_sampler: no_duplicates
  • multi_dataset_batch_sampler: round_robin
  • router_mapping: {}
  • learning_rate_mapping: {}

Training Logs

Epoch Step Training Loss spearman_cosine
-1 -1 - 0.8203
0.4558 500 0.1643 -
0.9116 1000 0.1076 -

Training Time

  • Training: 33.7 minutes

Framework Versions

  • Python: 3.12.13
  • Sentence Transformers: 5.5.1
  • Transformers: 5.9.0
  • PyTorch: 2.11.0+cu128
  • Accelerate: 1.13.0
  • Datasets: 5.0.0
  • Tokenizers: 0.22.2

Citation

BibTeX

Sentence Transformers

@inproceedings{reimers-2019-sentence-bert,
    title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
    author = "Reimers, Nils and Gurevych, Iryna",
    booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
    month = "11",
    year = "2019",
    publisher = "Association for Computational Linguistics",
    url = "https://arxiv.org/abs/1908.10084",
}

MultipleNegativesRankingLoss

@misc{oord2019representationlearningcontrastivepredictive,
      title={Representation Learning with Contrastive Predictive Coding},
      author={Aaron van den Oord and Yazhe Li and Oriol Vinyals},
      year={2019},
      eprint={1807.03748},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/1807.03748},
}
Downloads last month
-
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for dndjd03/klue-roberta-base-klue-sts-mrc

Finetuned
(1)
this model

Papers for dndjd03/klue-roberta-base-klue-sts-mrc

Evaluation results