[λ Όλ¬Έλ¦¬λ·°] AgentHPO: Large Language Model Agent for Hyper-Parameter Optimization
π 2020
π‘ ν΄λΉ ν¬μ€ν°μ μ 리ν λ΄μ©μ μ κ° λ Όλ¬Έμ μ½κ³ μ΄ν΄ν νλ¦λλ‘ λ΄μ©μ μ¬κ΅¬μ±νμ¬ μμ±νμ΅λλ€. λ°λΌμ κΈμ μμ λͺ© λ° μμ λ²νΈλ μ€μ λ Όλ¬Έμ ꡬμ±κ³Ό λ€λ₯Ό μ μμ΅λλ€!
1. Introduction
1-1. Motivation
μ ν΅μ μΌλ‘ HPO (Hyperparameter Optimization)λ μ¬λμ μ λ¬Έμ±μ ν¬κ² μμ‘΄ν΄ μλ€. νμ§λ§ νμ΄νΌνλΌλ―Έν°μ κ΅¬μ± λ²μκ° λκ³ , taskλ³ μꡬ μ¬νμ΄ λ³΅μ‘νμ¬ HPOλ μ¬λμ΄ μ§μ μλμΌλ‘ νκΈ°μλ μκ°μ΄ λ§μ΄ μμλλ μμ μ΄λ€.
μ΄λ¬ν μλμ μΈ HPOμ λ Έλλ ₯μ μ€μ΄κΈ° μν΄, μ¬λμ κ°μ μ μ€μΌ μ μλ μλνλ λ¨Έμ λ¬λ (AutoML) νλ μμν¬λ₯Ό μ±ννκΈ° μμνμλ€.
1-2. Limitations of Existing Methods
AutoML κΈ°λ°μ HPOκ° κ°λ₯μ±μ 보μ¬μ£Όμμμλ λΆκ΅¬νκ³ , μ¬μ ν λ€μκ³Ό κ°μ λ¬Έμ μ λ€μ΄ μ‘΄μ¬νλ€.
- Time-Intensive Trials: λΈλλ°μ€ μ΅μ νλ₯Ό μν΄ μλ§μ μ€νμ ν΄μΌ νλλ°, 볡μ‘ν taskλ λκ·λͺ¨ λ°μ΄ν°μ μμλ ν° λΆλ΄μ΄ λλ€.
- Complex Setup: μ€μ κ³Όμ μ΄ λ³΅μ‘νκΈ° λλ¬Έμ, μ λ¬Έκ°μ κ°λ μ΄ μμΌλ©΄ μλͺ»λ ꡬμ±μΌλ‘ μΈν΄ λΉν¨μ¨μ±μ΄λ μ±λ₯ μ νκ° λ°μν μ μλ€.
- Lack of Interpretability: λλΆλΆμ AutoML λ°©λ²μ κ³Όμ μ΄ ν¬λͺ νμ§ μμ, μ ν΄λΉ νμ΄νΌνλΌλ―Έν°λ₯Ό μ ννλμ§, λͺ¨λΈμ μ΄λ€ μν₯μ λ―ΈμΉλμ§ λ±μ λͺ νν μ΄ν΄νκΈ° μ΄λ ΅λ€.
1-3. Contributions
- HPO taskμ LLM κΈ°λ°μ μμ¨ μμ΄μ νΈλ₯Ό μ²μμΌλ‘ λμ νλ€.
- λ¨Έμ λ¬λ νλ‘μΈμ€λ₯Ό μλννκ³ μ΅μ ννλ λ° μμ΄ LLMμ΄ κ°μ§ κ΄λ²μν μλκ³Ό μ μμ±μ μ μ¦νλ€.
- Creatorμ ExecutorλΌλ λ μμ΄μ νΈμ νμ μ ν΅ν΄ μ λ¬Έ μ§μμ΄ λΆμ‘±ν μ¬μ©μλΌλ λ¨Έμ λ¬λ λͺ¨λΈμ ν¨μ¨μ μΌλ‘ μ΅μ νν μ μλλ‘ λλλ€.
- λ€μν λλ©μΈμ κ±ΈμΉ HPO taskμ λν΄ μ€νμ μννμ¬, μ μλ λ°©λ²μ΄ μ°μν μ±λ₯μ λ°νν¨μ μ μ¦νλ€.
2. Methods
2-1. Creator Agent
Creator μμ΄μ νΈλ μ¬μ©μκ° λ°μ΄ν°μ
νΉμ±μ΄λ μ΅μ ν λͺ©ν λ±μ μμ°μ΄λ‘ μ
λ ₯νλ©΄, μ΄λ₯Ό ν΄μν΄ μ΄κΈ° νμ΄νΌνλΌλ―Έν°λ₯Ό μμ±νλ€.
λν μ΄νμ νλ ¨ κΈ°λ‘μ λΆμνμ¬ νλΌλ―Έν°λ₯Ό λ°λ³΅μ μΌλ‘ κ°μ νλ μν μ μννλ€.
μ¬μ©μκ° μ
λ ₯νλ ν둬ννΈ $\mathcal{B}$λ μλμ κ°μ΄ ꡬμ±λμ΄ μλ€.
μ΄λ₯Ό ν΅ν΄ LLMμ΄ νΉμ λ¨Έμ λ¬λ μμ
μ μ ν©ν νμ΄νΌνλΌλ―Έν°λ₯Ό μμ±ν λΏλ§ μλλΌ, μ΄λ₯Ό λ°λ³΅μ μΌλ‘ κ°μ ν μ μλλ‘ λμμ μ€λ€.
- HP information
- μ΅μ νκ° νμν νμ΄νΌνλΌλ―Έν°μ μ΄λ¦κ³Ό μ€λͺ λͺ©λ‘
- LLMμ΄ νμν μ μλ 곡κ°μ μ ννκΈ° μν΄ κ° κ°μ λ²μ
- Dataset Information
- λ°μ΄ν°μ μ μν μ, νΉμ§ μ°¨μ, νκ² ν΄λμ€ μ λ±
- Optimization Goal
- Creator Agentκ° λ¬μ±ν΄μΌ νλ λͺ©ν
- λͺ¨λΈμ μ±λ₯μ λνλ΄λ μ§νλ₯Ό μ΅λν or μ΅μν
- λ©λͺ¨λ¦¬ μ¬μ©λμ΄λ νλ ¨ μκ°
- Model Information
- λͺ¨λΈμ μν€ν μ² λ° νλΌλ―Έν° μ λ±
Creator μμ΄μ νΈλ μλμ κ°μ΄ ννλλ€.
\[C=init(LLM,\mathcal{B}) \tag{1}\]2-2. Executor Agent
Executor μμ΄μ νΈλ Creator μμ΄μ νΈκ° μ€μ ν κ°μ λ°νμΌλ‘ μ€μ λͺ¨λΈ νλ ¨μ μννκ³ , μ€ν λ°μ΄ν°λ₯Ό κΈ°λ‘νκ³ , κ²°κ³Όλ₯Ό λΆμνλ μν μ μννλ€.
μ°λ¦¬κ° Executor μμ΄μ νΈμκ² μ₯μ΄μ£Όλ λꡬ $\mathcal{T}$λ μλμ κ°λ€.
μμ΄μ νΈλ μ΄λ¬ν λꡬλ₯Ό μ΄μ©ν΄ ꡬ체μ μΈ νλμ μννλ€.
- Change HP Configs
- μλ‘κ² μ λ°μ΄νΈλ ꡬμ±μ λ§μΆμ΄ λͺ¨λΈμ νμ΄νΌνλΌλ―Έν°λ₯Ό μμ
- Training Models
- λ³κ²½λ μ€μ μ κ²°κ³Όλ₯Ό νκ°νκΈ° μν΄ μ€μ λͺ¨λΈ νλ ¨ μ€ν¬λ¦½νΈλ₯Ό μ€ν
- Analyze Results
- λͺ¨λΈ νλ ¨μ΄ μλ£λλ©΄, μμ΄μ νΈλ train λ° valid metricμ λ³ν κΆ€μ μ΄ ν¬ν¨λ νλ ¨ λ‘κ·Έλ₯Ό λΆμνμ¬ μ€νμ λν μ’ ν©μ μΈ μμ½μ μμ±
- Record Results
- ν₯ν μ΅μ ν κ³Όμ μμ μ°Έμ‘°ν μ μλλ‘, νλ ¨ κ²°κ³Όμ λΆμ λ΄μ©μ experimental logsμ λ¬Έμννμ¬ μ μ₯
Executor μμ΄μ νΈλ μλμ κ°μ΄ ννλλ€.
\[E=init(LLM,\mathcal{T}) \tag{2}\]2-3. Iterative Hyperparameter Optimization
AgentHPO νλ μμν¬ λ΄μμ Creator μμ΄μ νΈμ Executor μμ΄μ νΈλ μλ‘ νλ ₯νμ¬ λ°λ³΅μ μΌλ‘ νμ΄νΌνλΌλ―Έν°λ₯Ό μ΅μ ννλ€.
- Creator μμ΄μ νΈλ κ·Έλμ λμ λ μ€ν λ‘κ·Έ $\mathcal{L}$μ λΆμνκ³ , μ΄λ₯Ό λ°νμΌλ‘ μλ‘μ΄ νμ΄νΌνλΌλ―Έν° μΈνΈ $H_t$μ κ·Έ κ°μ μ νν ν©λ¦¬μ μΈ μ΄μ $R_t$λ₯Ό μμ±νλ€.
- Executor μμ΄μ νΈλ μ λ¬λ°μ νμ΄νΌνλΌλ―Έν° $H_t$λ₯Ό μ¬μ©νμ¬ μ€μ μ€νμ μννκ³ , μ€νμ΄ λλλ©΄ μ±λ₯ μ§νμ μ’ ν©μ μΈ μ¬ν λΆμ κ²°κ³Όκ° ν¬ν¨λ $L_t$λ₯Ό λμΆνλ€.
- μ΄λ² μ€ν μ νμ΄νΌνλΌλ―Έν° $H_t$, μ ν κ·Όκ±° $R_t$, μ΅μ’ μ€ν κ²°κ³Ό $L_t$κ° μ€ν λ‘κ·Έ $\mathcal{L}$μ μΆκ°λλ€.
μ€ν λ‘κ·Έ $\mathcal{L}$μ λ¨μν μ«μκ° μ ν κΈ°λ‘μ΄ μλλΌ, μμ΄μ νΈλ€μ κ³Όκ±° κ΄μ°° κ²°κ³Ό, λΆμ, κ·Έλ¦¬κ³ νλμ΄ λͺ¨λ κΈ°λ‘λ λμ μ μ₯μ μν μ νλ€. (μΌμ’ μ memory block)
2-4. Explainable Hyperparameter Optimization
κΈ°μ‘΄μ AutoMLμ΄λ μκ³ λ¦¬μ¦ κΈ°λ° νμ λ°©μμ λ¨μν μ΅μ μ μ«μλ§ λ±μ΄λ΄λ λΈλλ°μ€μ κ°μλ€.
λ°λ©΄ AgentHPOλ μ€ν λ‘κ·Έμ μμΉμ κ²°κ³ΌλΏλ§ μλλΌ, κ° μ€νμ λν μ€λͺ μ ν¨κ» κΈ°λ‘νκΈ° λλ¬Έμ, HPO κ³Όμ μ ν΄μ κ°λ₯μ± λ¬Έμ λ₯Ό ν΄κ²°ν μ μλ€.
λν λͺ¨λ μ΅μ ν κ³Όμ μ΄ λλ ν, Creator μμ΄μ νΈλ μ 체 HPO κ³Όμ μ λν λΆμ 리ν¬νΈλ₯Ό μ¬μ©μμκ² μ 곡νλ€. μ¬μ©μλ μ΄ μμ½λ λΆμμ μ½μ΄λ³΄λ©°, κ°κ°μ νμ΄νΌνλΌλ―Έν° λ³νκ° λͺ¨λΈ μ±λ₯μ ꡬ체μ μΌλ‘ μ΄λ€ μν₯μ λ―Έμ³€λμ§λ₯Ό νμ ν μ μκ² λλ€.
λ λμκ° κ²°κ³Όλ₯Ό λΆμνλ λ°μ κ·ΈμΉμ§ μκ³ , μμΌλ‘ λͺ¨λΈμ μ±λ₯μ λ λμ΄μ¬λ¦¬κΈ° μν΄ μλν΄ λ³Ό λ§ν μ μ¬μ μΈ μ΅μ ν λ°©ν₯κ³Ό μ λ΅κΉμ§ μ μνλ€.
3. Experiments
λ¨Όμ λ Όλ¬Έμ μ€ν ννΈμμ μ¬μ©νλ μ©μ΄ λͺ κ°λ§ μ 리νκ² λ€.
- Trial: νΉμ νμ΄νΌνλΌλ―Έν° μ‘°ν© νλλ₯Ό μ μ©νμ¬ λͺ¨λΈμ λ± ν λ² νλ ¨μν€κ³ νκ°νλ λ¨μΌ κ³Όμ
- Run: λͺ©νν νμμ Trialμ λͺ¨λ λ§μΉ λκΉμ§μ μ 체 νμ΄νΌνλΌλ―Έν° μ΅μ ν κ³Όμ 1ν (Trialμ μ§ν©)
- Experiment: νλμ μ€ν κ·Έ μ체
3-1. Benchmark setting
Table 1μ
Dataset
LLMμ΄ κ³Όκ±°μ νμ΅ν λ°μ΄ν°λ₯Ό μκΈ°νμ§ μκ³ μ²μ 보λ μλ‘μ΄ λ¬Έμ μ λν΄μλ ν¨κ³Όμ μΌλ‘ λμν μ μλμ§ μ¦λͺ νκΈ° μν΄, classicν λ°μ΄ν°μ λΏλ§ μλλΌ LLM μ¬μ νμ΅ μ΄νμ μμ±λ Kaggle λ°μ΄ν°μ λ ν¬ν¨μμΌ°λ€.
Baseline
κ°μ₯ λνμ μΈ νμ΄νΌνλΌλ―Έν° μ΅μ ν κΈ°λ²μΈ Random Searchμ Bayesian Optimizationμ κΈ°λ³Έ λΉκ΅κ΅°μΌλ‘ μ±ννλ€.
κ° μ€νλ§λ€ 10λ²μ runμ κ±°μ³ μ΄ 100λ²μ Trialμ μννλ€.
μ ν μ°κ΅¬μ λ°λ₯΄λ©΄, Random Searchλ₯Ό 100λ² μνν κ²½μ° μ΅μ μ κ°κΉμ΄ μμμ μ°ΎμλΌ νλ₯ μ΄ 99%μ λ¬νλ€κ³ νλ€.
λ°λΌμ 100λ²μ Random Searchμμ λμ¨ κ°μ₯ λμ μ μλ₯Ό μΈκ° μ λ¬Έκ°κ° λ
Έλ ₯νμ λ λλ¬ν μ μλ νμ€μ μΈ μ΅κ³ μ±λ₯ (Human Best)μΌλ‘ κ°μ£Όνκ³ νκ° κΈ°μ€μΌλ‘ μΌμλ€κ³ νλ€.
κ·Έλ¦¬κ³ LLMμ νμ©ν λ λ€λ₯Έ μ΅μ ν λ°©λ²λ‘ μΈ OPROλ λΉκ΅κ΅°μΌλ‘ ν¬ν¨νμλ€.
AgentHPO Setting
AgentHPOλ ν μ€νλΉ μ΄ 10λ²μ μ΅μ ν Trialμ μ§ννμκ³ , μ±λ₯μ΄ μ΄λ»κ² ν₯μλλμ§ κ΄μ°°νκΈ° μν΄ 1λ²μ§Έ, 3λ²μ§Έ, 5λ²μ§Έ, 10λ²μ§Έ μλ μμ μμμ μ΅κ³ μ±λ₯ μ§νλ₯Ό κΈ°λ‘νμλ€.
LLMμΌλ‘λ OpenAIμ GPT-4μ GPT-3.5λ₯Ό λͺ¨λ μ¬μ©νμκ³ , API λΉμ© λ¬Έμ λ‘ μΈν΄ GPT-4λ 5λ²μ μ€νμ, GPT-3.5λ 10λ²μ μ€νμ μ§ννμλ€.
λ€μν νμ΄νΌνλΌλ―Έν° 곡κ°μ μ κ·Ήμ μΌλ‘ νμν μ μλλ‘ Creator μμ΄μ νΈμ temperature νλΌλ―Έν°λ₯Ό 1λ‘ μ€μ νμλ€.
3-2. Trajectory over Trials
Figure 3μ Trial μκ° λμ΄λ¨μ λ°λΌ λͺ¨λΈμ μ±λ₯μ΄ μ΄λ»κ² λ³νλμ§ μΆμ νκ³ , μ΄λ₯Ό κΈ°μ‘΄ λ² μ΄μ€λΌμΈκ³Ό λΉκ΅ν κ·Έλνμ΄λ€.
3-3. Influence of Experimental Logs
Figure 4λ μμΈν μ€ν λ‘κ·Έλ₯Ό μ 곡νλ κ²μ΄ μ΅μ νμ μ§μ§ λμμ΄ λλμ§ νμΈνκΈ° μν΄, Link Prediction taskμμ μ±λ₯μ λΉκ΅ν κ·Έλνμ΄λ€.
μ¬κΈ°μ OPROλ λ¨μν νμ΄νΌνλΌλ―Έν° κ°κ³Ό μ΅μ’ μ μ μλ§ κΈ°λ‘νλ λͺ¨λΈμ΄λ€.
μ€νμ ν΅ν΄ νλ ¨ λ‘κ·Έκ° μμ΄μΌ νλ ¨ ν¨ν΄μ νμ νμ¬ λ€μλ²μ λ λμ νμ΄νΌνλΌλ―Έν°λ₯Ό μ μν μ μμμ μ μ¦νλ€.
3-4. Optimization Strategy Analysis
Figure 5λ LLMμ΄ λͺ©μ ν¨μμ λν λͺ μμ μΈ μ 보 μμ΄λ μ€μ€λ‘ νμ μ λ΅μ μ립νκ³ μ΅μ ν κΆ€μ μ νμ±ν μ μλμ§λ₯Ό κ²μ¦ν κ²°κ³Όμ΄λ€.
μ΄ μ€νμ LLMμκ² λͺ©μ ν¨μλ₯Ό μ§μ μλ €μ£Όμ§ μμ μ± μ§νλμλ€.
λμ LLMμ΄ μμμ $x, y$ κ°μ μ μνλ©΄ μμ€ν
μ΄ ν΄λΉ ν¨μμ λ°λ₯Έ κ²°κ³Όκ°λ§ λ°νν΄ μ£Όλ©°, LLMμ΄ μ΄ κ²°κ³Όκ°λ€μ λ°νμΌλ‘ μ€μ€λ‘ μΆλ‘ νμ¬ ν¨μμ μ΅μκ°μ μ°Ύμκ°λλ‘ μ€κ³λμλ€.
ꡬ체μ μΌλ‘ GPT-3.5μκ²λ $x,y\in[-5,5]$ λ²μμμ $f(x, y) = (x - 2)^2 + (y - 3)^2$ ν¨μμ μ΅μκ°μ, GPT-4μκ²λ $x,y\in[-10,10]$ λ²μμμ $f(x, y) = (x - 3)^2 + (y - 5)^2$ ν¨μμ μ΅μκ°μ μ°Ύλλ‘ νμλ€.
λ λͺ¨λΈ λͺ¨λ μ²μμλ μ€κ°κ°μμ μμνμμΌλ©°, GPT-3.5λ educated random search, GPT-4λ λ κ³ λνλ μ λ΅μ ꡬμ¬νλ€κ³ νλ€.
3-5. Explainable Hyperparameter Optimization
Figure 6μ
λͺ¨λΈμ΄ λμΆν κ²°κ³Όκ° μ¬μ©μκ° λ©λν μ μλ ννμΈμ§, μ¦ βν΄μ κ°λ₯μ±(Interpretability)βμ νκ°νκΈ° μν΄ μμ΄μ νΈκ° μμ±ν μ€ν λ‘κ·Έ(μ΄μ μ λΆμ λ΄μ©)λ₯Ό μ§μ μΌλ‘ λΆμν






