Algomatic Tech Blog

Algomaticの開発チームによる Tech Blog です

LLM

2024.06 - Algomaticで話題になった生成AIニュースまとめ

こんにちは。Algomatic NEO(x) の宮脇(@catshun_)です。 本記事では Inside Algomatic という podcast の「Algomaticで話題になった生成AIニュースまとめ」という回で用意している会話ネタの一部として、6月に話題となったニュース一覧を公開します。なお…

Claude 3.5 Sonnet の評価に関する備忘録

LLM

こんにちは。Algomatic NEO(x) の宮脇(@catshun_)です。 本記事では弊社 podcast の「Algomaticで話題になった生成AIニュースまとめ」という回で用意している会話ネタの一つとして "Claude 3.5 Sonnet Model Card Addendum" を読んだので、その備忘を共有…

自動プロンプト最適化をやってみた

はじめまして!データサイエンティストの山内(@jof_5)です。 本記事では、日々、プロンプト開発されている皆様に向けて、プロンプトを効率的に開発する手法の一つである「自動プロンプト最適化」について記載いたします。 1. プロンプトエンジニアリングの必…

社内文書検索&QAシステムの RAG ではないところ

こんにちは。NEO(x) 機械学習エンジニアの宮脇(@catshun_)です。 RAG システムの開発、いざ業務に統合するとなると結構大変ですよね。 構築してみたがユーザ数が伸びず、、なんてことはよくあると思います。 実際こんな記事も話題になりましたね。 本記事…

LLM でブラウザを操作する WEB エージェントと周辺技術のざっくり紹介

本記事では LLM を用いたブラウザ操作を目的とした WEBエージェントとその周辺記述について紹介します。

LLM評価ツールpromptfooとアサーションの解説

LLM やプロンプトの性能評価を気軽に行うことができる評価ツール promptfoo を解説します。特にアサーションタイプの種類に着目してまとめます。

Devin を含むAIソフトウェアエンジニアと周辺技術のざっくり紹介

Devinの公開から注目を浴びているAIソフトウェアエンジニアについての紹介です。Devika, Open Devin, SWE-agent, AutoDev の他、MetaGPT, ChatDev, Data Interpreter などの関連情報を紹介しています。

LangGraph を用いた LLM エージェント、Plan-and-Execute Agents の実装解説

はじめに こんにちは。Algomatic LLM STUDIO 機械学習エンジニアの宮脇(@catshun_)です。 Wang+’23 - A Survey on Large Language Model Based Autonomous Agents ChatGPT が発表されてからおよそ 1 年が経ち、AutoGPT, BabyAGI, HuggingGPT, Generative A…

計画に基づく LLM 推論において並列実行可能な計画編成を行う LLM Compiler の解説

LLM エージェントにおける基本機能の一つである計画立案について、タスクリストを並列に実行する LLM Compiler について解説します。逐次的にタスクを処理する ReAct よりも高いトークン効率とレイテンシを実現しつつ、ReAct よりも一貫して高い正解率を達成…

計画立案による思考と行動の切り分けによってトークン効率の良い推論を実現する ReWOO の論文紹介

LLM エージェントにおける基本機能の一つである計画立案について、計画と実行の2段階による推論を行う ReWOO について解説します。ReWOO では Decomposed-first な推論を行うため ReAct よりもトークン消費の効率が良く、同程度の正解率を実現します。

Let's think step by step を超える?計画立案を伴う Plan-and-Solve Prompting の論文紹介

LLM エージェントにおける基本機能の一つである計画立案について、その先駆けとなる Plan-and-Solve Prompting について解説します。Zero-shot Prompting (step-by-step に答えて)よりも一貫して正解率の高いプロンプトを提案しています。

大規模言語モデル(LLM)における日本語評価の概観

大規模言語モデル(LLM)の日本語運用性能を評価するための内容をまとめました。評価方法を人手評価・LLM-as-a-judge・自動評価指標に分類し、JGLUEやMT-Benchなどのツールの利点や課題を解説します。