Post

[논문리뷰] ReAct: Synergizing Reasoning and Acting in Language Models

πŸ“ ICLR 2023

[논문리뷰] ReAct: Synergizing Reasoning and Acting in Language Models

[Paper] [GitHub]

πŸ’‘ ν•΄λ‹Ή ν¬μŠ€ν„°μ— μ •λ¦¬ν•œ λ‚΄μš©μ€ μ œκ°€ 논문을 읽고 μ΄ν•΄ν•œ νλ¦„λŒ€λ‘œ λ‚΄μš©μ„ μž¬κ΅¬μ„±ν•˜μ—¬ μž‘μ„±ν–ˆμŠ΅λ‹ˆλ‹€. λ”°λΌμ„œ κΈ€μ˜ μ†Œμ œλͺ© 및 μˆ˜μ‹ λ²ˆν˜ΈλŠ” μ‹€μ œ λ…Όλ¬Έμ˜ ꡬ성과 λ‹€λ₯Ό 수 μžˆμŠ΅λ‹ˆλ‹€!

1. Introduction

1-1. Motivation

인간 μ§€λŠ₯의 λ…νŠΉν•œ νŠΉμ§• 쀑 ν•˜λ‚˜λŠ” 행동과 언어적 좔둠을 μ›ν™œν•˜κ²Œ κ²°ν•©ν•˜μ—¬ 문제λ₯Ό ν•΄κ²°ν•˜λŠ” λŠ₯λ ₯이닀.

졜근 LLM μ—°κ΅¬λŠ” 크게 두 갈래둜 λ°œμ „ν•΄ μ™”λ‹€.
ν•˜λ‚˜λŠ” Chain-of-Thought (CoT)처럼 단계별 μΆ”λ‘  λŠ₯λ ₯을 κ·ΉλŒ€ν™”ν•˜μ—¬ μˆ˜ν•™μ΄λ‚˜ 상식 문제λ₯Ό ν‘ΈλŠ” 연ꡬ이며, λ‹€λ₯Έ ν•˜λ‚˜λŠ” ν…μŠ€νŠΈλ‘œ λ³€ν™˜λœ μ£Όλ³€ ν™˜κ²½μ„ κ΄€μ°°ν•˜κ³  λ‹€μŒ 행동을 μ˜ˆμΈ‘ν•˜λŠ” μ—μ΄μ „νŠΈ 연ꡬ이닀.

ν•˜μ§€λ§Œ μ§€κΈˆκΉŒμ§€λŠ” μΆ”λ‘ κ³Ό 행동이 μ–΄λ–»κ²Œ μ‹œλ„ˆμ§€λ₯Ό λ‚΄λ©° κ²°ν•©ν•  수 μžˆλŠ”μ§€μ— λŒ€ν•œ μ—°κ΅¬λŠ” λΆ€μ‘±ν–ˆλ‹€.

1-2. Limitations of Existing Methods

  • 단독 μΆ”λ‘  (Reason Only) λͺ¨λΈμ˜ ν•œκ³„

    Chain-of-Thought (CoT)와 같은 μΆ”λ‘  방식은 λͺ¨λΈμ˜ λ‚΄λΆ€ μ§€μ‹μœΌλ‘œλ§Œ μƒκ°ν•˜λŠ” λΈ”λž™λ°•μŠ€ ν˜•νƒœμ΄λ‹€.
    즉, μ™ΈλΆ€ μ„Έκ³„μ˜ μ§„μ§œ 정보와 μ—°κ²°λ˜μ–΄ μžˆμ§€ μ•ŠκΈ° λ•Œλ¬Έμ—, 상황에 맞게 λ°˜μ‘ν•˜κ±°λ‚˜ 지식을 μ—…λ°μ΄νŠΈν•˜μ§€ λͺ»ν•œλ‹€.
    이둜 인해 사싀이 μ•„λ‹Œ λ‚΄μš©μ„ μ§€μ–΄λ‚΄λŠ” hallucinationμ΄λ‚˜ 초기 μΆ”λ‘ μ˜ μ‹€μˆ˜κ°€ μ—°μ‡„μ μœΌλ‘œ μ „νŒŒλ˜λŠ” λ¬Έμ œκ°€ λ°œμƒν•œλ‹€.

  • 단독 행동 (Act Only) λͺ¨λΈμ˜ ν•œκ³„

    μƒν˜Έμž‘μš© ν™˜κ²½μ—μ„œ, ν–‰λ™λ§Œ μ˜ˆμΈ‘ν•˜λŠ” λͺ¨λΈλ“€μ€ λ‹Ήμž₯ λˆˆμ•žμ˜ 행동을 κ²°μ •ν•˜λŠ” 데만 κΈ‰κΈ‰ν•˜λ‹€.
    μ΄λŸ¬ν•œ λͺ¨λΈλ“€μ€ 더 고차원적인 λͺ©ν‘œλ‘€ ν–₯ν•΄ μΆ”μƒμ μœΌλ‘œ μΆ”λ‘ ν•˜κ±°λ‚˜, 행동을 λ’·λ°›μΉ¨ν•˜κΈ° μœ„ν•΄ 이전 상황듀을 κΈ°μ–΅ν•΄λ‘λŠ” working memoryλ₯Ό μœ μ§€ν•˜μ§€ λͺ»ν•˜λŠ” 단점이 μžˆλ‹€.

fig1 [좜처]

1-3. Contributions

2. Methods

2-1. Synergizing Reasoing + Acting

κΈ°μ‘΄ AI μ—μ΄μ „νŠΈκ°€ ν™˜κ²½κ³Ό μƒν˜Έμž‘μš©ν•˜λŠ” 방식

νŠΉμ • μ‹œκ°„ $t$에 μ—μ΄μ „νŠΈλŠ” ν™˜κ²½μœΌλ‘œλΆ€ν„° κ΄€μΈ‘κ°’ $o_t \in \mathcal{O}$λ₯Ό λ°›κ³ , μ£Όμ–΄μ§„ λ¬Έλ§₯ $c_t$에 따라 policy $\pi(a_t|c_t)$λ₯Ό 기반으둜 행동 $a_t \in \mathcal{A}$λ₯Ό μ·¨ν•œλ‹€.
μ—¬κΈ°μ„œ λ¬Έλ§₯ $c_t$λŠ” 과거의 λͺ¨λ“  κ΄€μΈ‘κ³Ό ν–‰λ™μ˜ 기둝, 즉 $c_t = (o_1, a_1, \dots, o_{t-1}, a_{t-1}, o_t)$을 μ˜λ―Έν•œλ‹€.

μ£Όμ–΄μ§„ λ¬Έλ§₯ $c_t$만 보고 λ°”λ‘œ λ‹€μŒ 행동 $a_t$λ₯Ό κ²°μ •ν•˜λŠ” 과정은 맀우 λ³΅μž‘ν•œ 좔둠을 μš”κ΅¬ν•˜κΈ° λ•Œλ¬Έμ— ν•™μŠ΅ν•˜κΈ°κ°€ μ–΄λ ΅λ‹€.

ReAct의 핡심 아이디어

ReActμ—μ„œλŠ” μ—μ΄μ „νŠΈκ°€ ν•  수 μžˆλŠ” 행동 곡간을 $\hat{\mathcal{A}} = \mathcal{A} \cup \mathcal{L}$둜 ν™•μž₯ν•˜μ˜€λ‹€.
μ—¬κΈ°μ„œ $\mathcal{L}$은 μ–Έμ–΄ κ³΅κ°„μœΌλ‘œ, 기쑴의 λ¬Όλ¦¬μ μ΄κ±°λ‚˜ μ‹œμŠ€ν…œμ μΈ 행동 $\mathcal{A}$에 μ–Έμ–΄ 곡간 $\mathcal{L}$을 μΆ”κ°€ν•œ 것이닀.

이 μ–Έμ–΄ κ³΅κ°„μ—μ„œμ˜ 행동 $\hat{a}_t \in \mathcal{L}$을 λ…Όλ¬Έμ—μ„œλŠ” 생각 λ˜λŠ” μΆ”λ‘  κ³Όμ • (reasoning trace)이라고 λΆ€λ₯Έλ‹€.
μš°λ¦¬κ°€ μ•„λŠ” 일반적인 행동은 λ²„νŠΌμ„ λˆ„λ₯΄κ±°λ‚˜ 검색을 ν•˜λŠ” λ“± ν™˜κ²½μ— 영ν–₯을 미치고 μƒˆλ‘œμš΄ 관츑값을 κ°€μ Έμ˜¨λ‹€. ν•˜μ§€λ§Œ μ–Έμ–΄ κ³΅κ°„μ—μ„œμ˜ 행동인 생각은, μ™ΈλΆ€ ν™˜κ²½μ— 영ν–₯을 μ£Όμ§€ μ•ŠκΈ° λ•Œλ¬Έμ— ν™˜κ²½μœΌλ‘œλΆ€ν„° λŒμ•„μ˜€λŠ” 관츑값이 μ—†λ‹€.
λŒ€μ‹ , 생각은 ν˜„μž¬κΉŒμ§€μ˜ 상황 $c_t$λ₯Ό λΆ„μ„ν•˜μ—¬ μœ μš©ν•œ 정보λ₯Ό κ΅¬μ„±ν•˜κ³ , μ—μ΄μ „νŠΈμ˜ λ‚΄λΆ€ λ¬Έλ§₯을 $c_{t+1} = (c_t, \hat{a}_t)$둜 μ—…λ°μ΄νŠΈν•˜μ—¬ μ•žμœΌλ‘œ 더 λ‚˜μ€ μΆ”λ‘ κ³Ό 행동을 ν•  수 μžˆλ„λ‘ λ•λŠ” 역할을 ν•œλ‹€.

μ‰½κ²Œ μ„€λͺ…ν•΄μ„œ 생각은 κ³„νšμ„ μ„Έμš°κ³ , κ΄€μΈ‘λœ μ •λ³΄μ—μ„œ 핡심을 뽑아내고, μ§„ν–‰ 상황을 μΆ”μ ν•˜λŠ” λ“± λ‹€μ–‘ν•œ 역할을 μˆ˜ν–‰ν•˜λŠ” μΌμ’…μ˜ 행동이라고 μƒκ°ν•˜λ©΄ λœλ‹€.

ReActλŠ” 문제의 성격에 따라 생각을 μ–Όλ§ˆλ‚˜ 자주 ν• μ§€ μœ μ—°ν•˜κ²Œ μ‘°μ ˆν•œλ‹€.
λ³΅μž‘ν•œ μ§ˆλ¬Έμ— λŒ€ν•œ 닡변같이 좔둠이 μ€‘μš”ν•œ μž‘μ—…μ—μ„œλŠ” ν•œ λ‹¨κ³„λ§ˆλ‹€ 신쀑해야 ν•˜λ―€λ‘œ, [생각 β†’ 행동 β†’ κ΄€μ°°] μˆœμ„œλ₯Ό 맀번 λ²ˆκ°ˆμ•„ κ°€λ©° μ΄˜μ΄˜ν•˜κ²Œ λ°˜λ³΅ν•˜λ„λ‘ ν•˜μ˜€λ‹€.
κ²Œμž„κ³Ό 같이 μ˜μ‚¬κ²°μ •μ΄ μ€‘μš”ν•œ μž‘μ—…μ—μ„œλŠ” μ—¬λŸ¬ 번의 행동을 λΉ λ₯΄κ²Œ ν•΄μ•Ό ν•  λ•Œκ°€ λ§Žλ‹€. λ”°λΌμ„œ 맀번 μƒκ°ν•˜κΈ°λ³΄λ‹€λŠ”, λͺ¨λΈμ΄ 슀슀둜 νŒλ‹¨ν•˜μ—¬ κΌ­ ν•„μš”ν•œ μˆœκ°„μ—λ§Œ 띄엄띄엄 μ•Œμ•„μ„œ μƒκ°ν•˜λ„λ‘ μ„€μ •ν•˜μ˜€λ‹€.

ReAct의 μž₯점

  • Intuitive and easy to design: μ‚¬λžŒμ΄ 문제λ₯Ό ν’€ λ•Œ λ¨Έλ¦Ώμ†μœΌλ‘œ ν•˜λŠ” 생각을 κ·Έλƒ₯ μžμ—°μ–΄λ‘œ μ μ–΄μ„œ μ˜ˆμ‹œλ‘œ μ£Όλ©΄ 되기 λ•Œλ¬Έμ—, 직관적이닀.
  • General and flexible: μƒκ°μ˜ ν‘œν˜„μ΄ 자유둭고 μ–Έμ œ 생각할지 μœ μ—°ν•˜κ²Œ μ •ν•  수 있기 λ•Œλ¬Έμ—, μ „ν˜€ λ‹€λ₯Έ μ„±κ²©μ˜ task에 λ²”μš©μ μœΌλ‘œ μ‚¬μš©ν•  수 μžˆλ‹€.
  • Performant and robust: 1~6개의 μ˜ˆμ‹œλ§Œ 보고도 처음 λ³΄λŠ” 문제λ₯Ό 잘 ν‘Όλ‹€.
  • Human aligned and controllable: λͺ¨λΈμ΄ λ‹¨μˆœνžˆ μ •λ‹΅κ³Ό 행동을 λ±‰μ–΄λ‚΄λŠ” 게 μ•„λ‹ˆλΌ, μΆ”λ‘  과정을 λͺ¨λ‘ 보여쀀닀. 덕뢄에 λͺ¨λΈμ΄ 맞게 μƒκ°ν•˜κ³  μžˆλŠ”μ§€ μ‰½κ²Œ 검사할 수 있으며, λͺ¨λΈμ΄ 잘λͺ»λœ 생각을 ν•  λ•Œ μ‚¬λžŒμ΄ 쀑간에 κ°œμž…ν•΄ κ·Έ 생각을 κ³ μΉ  μˆ˜λ„ μžˆλ‹€.

2-2. Task Setup

Domains

지식 검색과 좔둠이 λͺ¨λ‘ ν•„μˆ˜μ μΈ 두 κ°€μ§€ 벀치마크λ₯Ό μ„ μ •ν–ˆλ‹€.

  • HotPot-QA: 두 개 μ΄μƒμ˜ μœ„ν‚€ν”Όλ””μ•„ λ¬Έμ„œλ₯Ό λ°”νƒ•μœΌλ‘œ μΆ”λ‘ ν•΄μ•Ό 정닡을 찾을 수 μžˆλŠ” multi-hop μ§ˆμ˜μ‘λ‹΅ task이닀.

  • FEVER: μ£Όμ–΄μ§„ μ£Όμž₯이 사싀인지 (SUPPORTS), 거짓인지 (REFUTES), ν˜Ήμ€ 정보가 λΆ€μ‘±ν•œμ§€ (NOT ENOUGH INFO)λ₯Ό κ²€μ¦ν•˜λŠ” task이닀.

Action Space

μ‚¬λžŒμ΄ 인터넷 μœ„ν‚€ν”Όλ””μ•„λ₯Ό κ²€μƒ‰ν•˜λŠ” 방식을 λͺ¨λ°©ν•˜μ—¬, λͺ¨λΈμ΄ μ‚¬μš©ν•  수 μžˆλŠ” 3κ°€μ§€ 행동 λͺ…λ Ήμ–΄ APIλ₯Ό μ •μ˜ν–ˆλ‹€.

  • search[entity]: μœ„ν‚€ν”Όλ””μ•„ λ¬Έμ„œκ°€ μžˆμ„ 경우 entity와 μΌμΉ˜ν•˜λŠ” 첫 5λ¬Έμž₯을 λ°˜ν™˜ν•˜κ±°λ‚˜, λ¬Έμ„œκ°€ 없을 경우 entity와 μœ μ‚¬ν•œ μƒμœ„ 5개의 검색어λ₯Ό μ œμ•ˆν•œλ‹€.

  • lookup[string]: ν˜„μž¬ νŽ˜μ΄μ§€ λ‚΄μ—μ„œ string λ¬Έμžμ—΄μ΄ ν¬ν•¨λœ λ‹€μŒ λ¬Έμž₯을 μ°ΎλŠ”λ‹€. (μ›Ή λΈŒλΌμš°μ €μ˜ Ctrl+F κΈ°λŠ₯κ³Ό 동일)

  • finish[answer]: λ„μΆœλœ μ΅œμ’… 정닡을 μ œμΆœν•˜κ³  탐색을 μ’…λ£Œν•œλ‹€.

2-3. Prompting Strategy & Advanced Methods

ReAct Prompting

기쑴의 ν”„λ‘¬ν”„νŒ…μ€ λ‹¨μˆœνžˆ μ§ˆλ¬Έμ„ λ˜μ Έμ„œ κ³§λ°”λ‘œ 닡을 μš”κ΅¬ν•˜κ±°λ‚˜, β€œμ°¨κ·Όμ°¨κ·Ό λ‹¨κ³„λ³„λ‘œ 생각해봐”라며 머릿속 생각 κ³Όμ •λ§Œ 적도둝 μœ λ„ν–ˆλ‹€.

반면, ReActμ—μ„œλŠ” ν”„λ‘¬ν”„νŠΈ μ•ˆμ— μ‚¬λžŒμ΄ μ‹€μ œλ‘œ 문제λ₯Ό ν‘ΈλŠ” 방식인 [생각 β†’ 행동 β†’ κ΄€μ°°]μ΄λΌλŠ” 3단계가 반볡적으둜 μˆœν™˜ν•˜λŠ” few-shot μ˜ˆμ‹œλ₯Ό ν¬ν•¨ν•˜μ˜€λ‹€.
μ—¬κΈ°μ„œ 생각은 μ§ˆλ¬Έμ„ μͺΌκ°œκ³ , κ΄€μ°°λœ μ •λ³΄μ—μ„œ 핡심을 μΆ”μΆœν•˜λ©°, λ‹€μŒ 검색 λ°©ν–₯을 μ•ˆλ‚΄ν•˜λŠ” 역할을 ν•œλ‹€.

Baseline

ReAct의 효과λ₯Ό 증λͺ…ν•˜κΈ° μœ„ν•΄ λ‹€μŒκ³Ό 같은 λŒ€μ‘°κ΅°μ„ μ„€μ •ν–ˆλ‹€.

  • Standard prompting: 생각, 행동, κ΄€μ°° κ³Όμ • 없이 μ •λ‹΅λ§Œ μš”κ΅¬ν•˜λŠ” ν”„λ‘¬ν”„νŠΈ 방식
  • CoT prompting: 행동과 κ΄€μ°° 과정을 λ°°μ œν•˜κ³ , μ™ΈλΆ€ 검색 없이 λ‚΄λΆ€ μ§€μ‹μœΌλ‘œ μƒκ°λ§Œ μˆ˜ν–‰ν•˜λŠ” ν”„λ‘¬ν”„νŠΈ 방식
  • Acting-only prompt: 생각 과정을 λ°°μ œν•˜κ³ , μ™ΈλΆ€ 검색 ν–‰λ™λ§Œ μˆ˜ν–‰ν•˜λŠ” ν”„λ‘¬ν”„νŠΈ 방식

λ…Όλ¬Έμ—μ„œλŠ” κΈ°μ‘΄ CoT의 μ„±λŠ₯을 λ³΄μ™„ν•˜κΈ° μœ„ν•΄, CoT-SC (CoT with Self-Consistency) 기법을 μΆ”κ°€ λΉ„κ΅κ΅°μœΌλ‘œ κ΅¬μ„±ν•˜μ˜€λ‹€.
단일 μΆ”λ‘  경둜만 νƒμƒ‰ν•˜λŠ” κΈ°μ‘΄ 방식과 달리, CoT-SCμ—μ„œλŠ” temperature 값을 0.7둜 μ„€μ •ν•˜μ—¬ λ™μΌν•œ μ§ˆλ¬Έμ— λŒ€ν•΄ 21개의 λ‹€μ–‘ν•œ μΆ”λ‘  경둜λ₯Ό μƒ˜ν”Œλ§ν•œλ‹€.
이후 μƒμ„±λœ λ‹΅λ³€λ“€ 쀑 κ°€μž₯ 많이 λ“±μž₯ν•œ 닡을 λ‹€μˆ˜κ²°λ‘œ μ±„νƒν•œλ‹€.

Combining Internal and External Knowledge

ReActλŠ” 사싀 확인에 κ°•ν•˜μ§€λ§Œ μœ μ—°μ„±μ΄ λ–¨μ–΄μ§ˆ 수 있고, CoTλŠ” μΆ”λ‘  κ΅¬μ‘°λŠ” 잘 μž‘μ§€λ§Œ hallucination에 μ·¨μ•½ν•˜λ‹€.

이λ₯Ό λ³΄μ™„ν•˜κΈ° μœ„ν•΄, λ…Όλ¬Έμ—μ„œλŠ” ReAct와 CoT-SC 두 방식을 λ²ˆκ°ˆμ•„ μ‚¬μš©ν•˜λŠ” heuristic witching μ „λž΅μ„ μ œμ•ˆν–ˆλ‹€.

  • ReAct β†’ CoT-SC: μ™ΈλΆ€ 검색을 ν•˜λ‹€κ°€ λ„ˆλ¬΄ 많이 ν—€λ§€λ©΄, 검색을 ν¬κΈ°ν•˜κ³  λͺ¨λΈμ˜ λ‚΄λΆ€ μ§€μ‹μœΌλ‘œ μ „ν™˜ν•˜λŠ” 방식
  • CoT-SC β†’ ReAct: λ¨Όμ € λ‚΄λΆ€ μ§€μ‹μœΌλ‘œ 닡을 μ—¬λŸ¬ 개 λ‚΄λ³Έ λ’€, λͺ¨λΈ 슀슀둜 확신이 μ—†μœΌλ©΄ μ™ΈλΆ€ 검색을 ν†΅ν•΄μ„œ 팩트λ₯Ό μ²΄ν¬ν•˜λŠ” 방식

Finetuning

ReAct Prompting 방식은 κ±°λŒ€ν•œ λͺ¨λΈμ—μ„œλŠ” 잘 ν†΅ν–ˆμ§€λ§Œ, 비ꡐ적 μž‘μ€ λͺ¨λΈλ“€μ€ μ˜ˆμ‹œ λͺ‡ 개만 보고 생각과 행동을 λ™μ‹œμ— ν•˜λŠ” λ³΅μž‘ν•œ ReAct 방식을 따라 ν•˜κΈ° νž˜λ“€μ–΄ν–ˆλ‹€.

λ”°λΌμ„œ λ…Όλ¬Έμ—μ„œλŠ” κ±°λŒ€ λͺ¨λΈμ΄ ReAct 방식을 μ‚¬μš©ν•΄ μ„±κ³΅μ μœΌλ‘œ 정닡을 맞힌 풀이 κ³Όμ • (trajectory) 3,000개λ₯Ό λͺ¨μ•„μ„œ, μž‘μ€ λͺ¨λΈμ„ νŒŒμΈνŠœλ‹ν•˜μ˜€λ‹€κ³  ν•œλ‹€.

μ‹€ν—˜ κ²°κ³Ό, 겨우 3,000개의 λ°μ΄ν„°λ‘œ νŒŒμΈνŠœλ‹λœ 8B λͺ¨λΈ 이 μžμ‹ λ³΄λ‹€ 8λ°° 큰 62B λͺ¨λΈμ΄ μ˜ˆμ‹œλ§Œ 보고 ν’€ λ•Œλ³΄λ‹€ 더 λ›°μ–΄λ‚œ μ„±λŠ₯을 λ³΄μ˜€λ‹€κ³  ν•œλ‹€.
심지어 νŒŒμΈνŠœλ‹λœ 62B λͺ¨λΈμ€ κ°€μž₯ κ±°λŒ€ν•œ 540B λͺ¨λΈμ„ ν”„λ‘¬ν”„νŒ…μœΌλ‘œ μ“Έ λ•Œλ³΄λ‹€λ„ μ„±λŠ₯이 뛰어났닀고 ν•œλ‹€.

결둠적으둜 λ‹¨μˆœνžˆ μ •λ‹΅λ§Œ μ™Έμš°κ²Œλ” ν•˜λŠ” 것이 μ•„λ‹ˆλΌ, 슀슀둜 μƒκ°ν•˜κ³  도ꡬλ₯Ό μ“°λŠ” 방법을 λ°°μš°λ„λ‘ ν•˜λ©΄ κ±°λŒ€ν•œ λͺ¨λΈλ§ˆμ € λ›°μ–΄λ„˜μ„ 수 μžˆλ‹€λŠ” 것을 증λͺ…ν•œ 것이닀.

μ•„λž˜ 그림은 각 λ°©μ‹μ˜ μΆ”λ‘  κ²°κ³Όλ₯Ό 보여쀀 것이닀.

2-4. Decision Making Tasks

μ–Έμ–΄ 기반의 λ³΅μž‘ν•œ μƒν˜Έμž‘μš© 및 μ˜μ‚¬κ²°μ • λŠ₯λ ₯을 ν‰κ°€ν•˜κΈ° μœ„ν•΄ 두 κ°€μ§€ ν™˜κ²½μ„ μΆ”κ°€λ‘œ λ„μž…ν–ˆλ‹€.

  • ALFWorld: ν…μŠ€νŠΈ 기반의 가상 μ§‘μ•ˆμΌ μˆ˜ν–‰ κ²Œμž„μœΌλ‘œ, μ—¬λŸ¬ ν•˜μœ„ λͺ©ν‘œλ₯Ό μ„Έμš°κ³  μΆ”μ ν•˜λŠ” λŠ₯λ ₯을 ν‰κ°€ν•œλ‹€.
  • WebShop: 118만 개의 μ‹€μ œ μ•„λ§ˆμ‘΄ μƒν’ˆ 데이터λ₯Ό ν™œμš©ν•œ μ›Ή μ‡Όν•‘ ν™˜κ²½μœΌλ‘œ, λ…Έμ΄μ¦ˆκ°€ λ§Žμ€ μ‹€μ œ μ›Ή ν™˜κ²½μ—μ„œμ˜ 탐색 및 κ²°μ • λŠ₯λ ₯을 ν‰κ°€ν•œλ‹€.

μ•žμ„  μ§ˆμ˜μ‘λ‹΅ task와 달리, μ˜μ‚¬κ²°μ • taskλŠ” μˆ˜ν–‰ν•΄μ•Ό ν•  ν–‰λ™μ˜ νšŸμˆ˜κ°€ 훨씬 λ§Žλ‹€. λ”°λΌμ„œ 맀번 생각과 행동을 κ΅μ°¨ν•˜μ§€ μ•Šκ³ , λͺ©ν‘œλ₯Ό μͺΌκ°œκ±°λ‚˜ 상황이 λ³€ν•˜λŠ” κ°€μž₯ μ€‘μš”ν•œ μˆœκ°„μ—λ§Œ λ“œλ¬Έλ“œλ¬Έ 생각을 ν•˜λ„λ‘ ν”„λ‘¬ν”„νŠΈλ₯Ό κ΅¬μ„±ν–ˆλ‹€.

fig2

3. Experiments

3-1. Comparison with different prompting methods

Table 1은 PaLM-540B 베이슀 λͺ¨λΈμ„ μ‚¬μš©ν•˜μ—¬, λ‹€μ–‘ν•œ ν”„λ‘¬ν”„νŒ… λ°©μ‹μ˜ μ„±λŠ₯을 λΉ„κ΅ν•œ ν‘œμ΄λ‹€.

fig3

λͺ¨λΈμ˜ λ‚΄λΆ€ 지식과 μ™ΈλΆ€ 검색을 μƒν˜Έ λ³΄μ™„μ μœΌλ‘œ κ²°ν•©ν•œ 방식 (ReAct β†’ CoT-SC λ˜λŠ” CoT-SC β†’ ReAct)이 졜고 μ„±λŠ₯을 κΈ°λ‘ν–ˆλ‹€λŠ” 것을 확인할 수 μžˆλ‹€.

3-2. different the number of CoT-SC samples

Figure 2λŠ” CoT-SCμ—μ„œ 의 μƒ˜ν”Œ 횟수λ₯Ό 늘릴 λ•Œ μ„±λŠ₯이 μ–΄λ–»κ²Œ λ³€ν•˜λŠ”μ§€ λ³΄μ—¬μ£ΌλŠ” κ·Έλž˜ν”„μ΄λ‹€.

fig4

μˆœμˆ˜ν•˜κ²Œ CoT-SC만 μ“°λŠ” 것보닀, ReActλ₯Ό κ²°ν•©ν•œ 방식듀이 μƒ˜ν”Œλ§ νšŸμˆ˜μ™€ 상관없이 μΌκ΄€λ˜κ²Œ 훨씬 높은 μ„±λŠ₯ 곑선을 κ·Έλ¦¬λŠ” 것을 확인할 수 μžˆλ‹€.

This post is licensed under CC BY 4.0 by the author.