情報密度無視のピクセル固定課金の隙を突く画像化ハック、賢いけど絶対対策される
Claudeは画像読むの苦手だから情報の欠損多いだろうし、どうせその内対策されるから一発ネタ位にしかならなさそう
ユーザー離れを起こすので値上げはしにくいだろうし、普通にAnthropicが経営破綻すると思うよ。
こういうのは思いついた人がこっそりやるべきであって公開してドヤるのはちょっといかがかと思う
笑う
削減できるのは入力トークンのみだから結果としては誤差かなー
おもしれぇ事考える人がいるなぁw
トヨタ自動車の企業文化(特に「紙1枚主義」)が最も有名です。
ワラタw なんか似たようなハックを何処かで見た気がするけど面白いこと考える人いるなぁ。たしかに日本語のほうが文字数多くて不利だから短文とか英文がいいみたいな話もあったが画像で圧縮するとはw
文字の形に一意性がある英語ならでは
画像を使って自然言語を介さずAIの脳に直接語りかけたい。さぞかし驚くだろうなあ
アプローチとしては面白いけど、最終的な計算量も圧縮されないならすぐ対策されてしまいそうな気がする
どうせすぐに対策されるでしょ
「テキストをそのまま処理せず、いったん画像として扱って、視覚経由で情報を圧縮・再解釈する」という発想はDeepSeek-OCRに似てるな
入力トークンは削減できても負荷がめちゃくちゃ上がりそう
こんなん、騒いだら防がれるに決まってんじゃん。お疲れ様です。
画像はビットマップ展開してトークナイザに無理矢理突っ込んでネイティブに処理される。LLMに届くトークン量に嘘はない訳だから裏技ではなく単に言語が圧縮できるだけだが、節約した分だけ精度も落ちると思うんだが。
ほかにもrtk-aiとgenshijinで入力・出力トークンをそれぞれ節約できる。今後AIの料金が上がるのは見えてるのでトークン節約は必須になる。
文字を画像で読ませるなんて天才にゃ!ボクも魚の写真を送れば釣れるかにゃ?
OCRのためのトークン使用量とトレードオフかな。
トークン節約
これ確か作者ドキュメントに書いてあるけど、不可逆圧縮でしょ。システムプロンプトを圧縮したいなら他にいくらでも有益なツールある。
こういうやり方で圧縮する際の言語による圧縮効率が気になる。漢字の方が文字が潰れやすいから日本語・中国語は不利かも。まあ使わないけど
公開したところで、塞がれるかな?費用は負荷に応じて設定されてる訳で、塞がれない気もする
Claude Codeの入力コンテキストをPNG画像に変換し、トークン費用を約6割削減するローカルプロキシ「pxpipe」が登場した 不確実な画像読み取りを許容できるタスクの切り分けが必要
たぶん、ふさぐ類いのものではなく、実際に圧縮できているのでは?DeepSeek-OCRとかあったじゃん。画像がどのようにトークンになるのか知らないので何とも言えないが。
日本語でこれをやるのは大変そうだね。漢字とか潰れるでしょ
画像を解釈するためにthinkingパートが伸びたり(thinkingは出力なので入力の5倍の価格)、入力の精度が下がった結果リトライが発生して、返って料金増える気がするんだけど、そのあたりも考慮して節約できてるのかな?
この記事をおすすめしました
「Fable 5では15回中13回の成功にとどまり、Opusモデルでは全滅」
アルファベット圏の言語と漢字圏ではその分岐点が違うと思うので、それについて触れてないと不誠実だなと思った。
圧縮系は明確な弱点があって安定性を犠牲にする。ちょっとでも崩れたら全部崩れかねない。別にチートでも何でもないから的外れ。作成コストを取るか、圧縮言語辞書作って安定性を図るか。
ClaudeのAPI費用が激減。システムプロンプトを「画像」として読ませる新ツールの仕組み | XenoSpectrum
情報密度無視のピクセル固定課金の隙を突く画像化ハック、賢いけど絶対対策される
Claudeは画像読むの苦手だから情報の欠損多いだろうし、どうせその内対策されるから一発ネタ位にしかならなさそう
ユーザー離れを起こすので値上げはしにくいだろうし、普通にAnthropicが経営破綻すると思うよ。
こういうのは思いついた人がこっそりやるべきであって公開してドヤるのはちょっといかがかと思う
笑う
削減できるのは入力トークンのみだから結果としては誤差かなー
おもしれぇ事考える人がいるなぁw
トヨタ自動車の企業文化(特に「紙1枚主義」)が最も有名です。
ワラタw なんか似たようなハックを何処かで見た気がするけど面白いこと考える人いるなぁ。たしかに日本語のほうが文字数多くて不利だから短文とか英文がいいみたいな話もあったが画像で圧縮するとはw
文字の形に一意性がある英語ならでは
画像を使って自然言語を介さずAIの脳に直接語りかけたい。さぞかし驚くだろうなあ
アプローチとしては面白いけど、最終的な計算量も圧縮されないならすぐ対策されてしまいそうな気がする
どうせすぐに対策されるでしょ
「テキストをそのまま処理せず、いったん画像として扱って、視覚経由で情報を圧縮・再解釈する」という発想はDeepSeek-OCRに似てるな
入力トークンは削減できても負荷がめちゃくちゃ上がりそう
こんなん、騒いだら防がれるに決まってんじゃん。お疲れ様です。
画像はビットマップ展開してトークナイザに無理矢理突っ込んでネイティブに処理される。LLMに届くトークン量に嘘はない訳だから裏技ではなく単に言語が圧縮できるだけだが、節約した分だけ精度も落ちると思うんだが。
ほかにもrtk-aiとgenshijinで入力・出力トークンをそれぞれ節約できる。今後AIの料金が上がるのは見えてるのでトークン節約は必須になる。
文字を画像で読ませるなんて天才にゃ!ボクも魚の写真を送れば釣れるかにゃ?
OCRのためのトークン使用量とトレードオフかな。
トークン節約
これ確か作者ドキュメントに書いてあるけど、不可逆圧縮でしょ。システムプロンプトを圧縮したいなら他にいくらでも有益なツールある。
こういうやり方で圧縮する際の言語による圧縮効率が気になる。漢字の方が文字が潰れやすいから日本語・中国語は不利かも。まあ使わないけど
公開したところで、塞がれるかな?費用は負荷に応じて設定されてる訳で、塞がれない気もする
Claude Codeの入力コンテキストをPNG画像に変換し、トークン費用を約6割削減するローカルプロキシ「pxpipe」が登場した 不確実な画像読み取りを許容できるタスクの切り分けが必要
たぶん、ふさぐ類いのものではなく、実際に圧縮できているのでは?DeepSeek-OCRとかあったじゃん。画像がどのようにトークンになるのか知らないので何とも言えないが。
日本語でこれをやるのは大変そうだね。漢字とか潰れるでしょ
画像を解釈するためにthinkingパートが伸びたり(thinkingは出力なので入力の5倍の価格)、入力の精度が下がった結果リトライが発生して、返って料金増える気がするんだけど、そのあたりも考慮して節約できてるのかな?
この記事をおすすめしました
「Fable 5では15回中13回の成功にとどまり、Opusモデルでは全滅」
アルファベット圏の言語と漢字圏ではその分岐点が違うと思うので、それについて触れてないと不誠実だなと思った。
圧縮系は明確な弱点があって安定性を犠牲にする。ちょっとでも崩れたら全部崩れかねない。別にチートでも何でもないから的外れ。作成コストを取るか、圧縮言語辞書作って安定性を図るか。